1.0.4-alpha
Pre-releasePortuguês Brasileiro
Informações gerais
Fonemas: Lista de Fonemas Usadas, formato IPA retiradas do projeto WikiPron
Dicionario: Dicionario, fornecido pelo projeto WikiPron
Foi usando REAPER para extração de F0 para
Extração de MCEP SPTK-4.3. Na extração de MCEP foram usados como base o artigo Simple Methods for Improving Speaker-Similarity of HMM-Based Speech Synthesis - Junichi Yamagishi, Simon King para valores de MCEP Order e Alpha para melhor extração para as vozes de 16hz e 44hz. Script para extração de STR do MaryTTS foi usando para extração de STR das vozes.
Valores usados:
| Sample Rate | MCEP Order | Alpha |
|---|---|---|
| 16000hz | 49 | 0.42 |
| 44000hz | 68 | 0.713969 |
Vozes
| Nome | Corpus usando | Descrição | MCD |
|---|---|---|---|
| Ana | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 | 3.80 |
| Paula | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 | 3.90 |
| Pieroni | THLS | Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) | 3,72 |
Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar
Alterações
-
Voz Niette foi renomeada como Ana e refeita usando as informações acima;
-
Nova Voz Adicionada (Paula):
- Voz feminina usando o corpus CETUC.
-
Foi modificado o script festvox/setup.sh das vozes.
- Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
- Economizará processamento, evitando o uso do modelo G2P para palavras que foram pré-processandas.
- Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
Edit 24/09/2025
Valores da função proclaim_voice da voz Pieroni, estavam sendo duplicandos para as vozes restantes com isso Speech Dispatcher não fazia reconhecimento das outras vozes. Extensão dos pacotes corrigidas adicionando .deb para APT fazer a instalação corretamente. Script festvox/g2p.h, foi atualizado com a alteração do ultimo commit.
Full Changelog: 1.0.3-alpha...1.0.4-alpha