Releases: PallasSpeechSystem/Fest-TTS
Release list
1.0.5-alpha
Vozes
| Nome | Corpus usando | Descrição | MCD |
|---|---|---|---|
| Ana | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 | 3.80 |
| Paula | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 | 3.90 |
| Pieroni | THLS | Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) | 5.92 |
Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar
Alterações
- O modelo g2p foi atualizado para nova versão do Phonetisaurus.
- Qualidade da voz Pieroni foi atualizada para 48Khz.
Full Changelog: 1.0.4-alpha...1.0.5-alpha
1.0.4-alpha
Português Brasileiro
Informações gerais
Fonemas: Lista de Fonemas Usadas, formato IPA retiradas do projeto WikiPron
Dicionario: Dicionario, fornecido pelo projeto WikiPron
Foi usando REAPER para extração de F0 para
Extração de MCEP SPTK-4.3. Na extração de MCEP foram usados como base o artigo Simple Methods for Improving Speaker-Similarity of HMM-Based Speech Synthesis - Junichi Yamagishi, Simon King para valores de MCEP Order e Alpha para melhor extração para as vozes de 16hz e 44hz. Script para extração de STR do MaryTTS foi usando para extração de STR das vozes.
Valores usados:
| Sample Rate | MCEP Order | Alpha |
|---|---|---|
| 16000hz | 49 | 0.42 |
| 44000hz | 68 | 0.713969 |
Vozes
| Nome | Corpus usando | Descrição | MCD |
|---|---|---|---|
| Ana | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 | 3.80 |
| Paula | CETUC | O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 | 3.90 |
| Pieroni | THLS | Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) | 3,72 |
Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar
Alterações
-
Voz Niette foi renomeada como Ana e refeita usando as informações acima;
-
Nova Voz Adicionada (Paula):
- Voz feminina usando o corpus CETUC.
-
Foi modificado o script festvox/setup.sh das vozes.
- Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
- Economizará processamento, evitando o uso do modelo G2P para palavras que foram pré-processandas.
- Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
Edit 24/09/2025
Valores da função proclaim_voice da voz Pieroni, estavam sendo duplicandos para as vozes restantes com isso Speech Dispatcher não fazia reconhecimento das outras vozes. Extensão dos pacotes corrigidas adicionando .deb para APT fazer a instalação corretamente. Script festvox/g2p.h, foi atualizado com a alteração do ultimo commit.
Full Changelog: 1.0.3-alpha...1.0.4-alpha
1.0.3-alpha
Novidades
- As vozes Pieroni e Niette foram construídos agora usado SPTK-4.3 para extração de MCEP veja o script $NIETTETTS_DEV/festvox_script/get_mcep_delta_sptk
- Voz Pieroni qualidade foi aumentada de 16hz para 48hz.
Bugs corregidos
Nenhum bug foi corrigido nessa versão.
Vozes do NietteTTS
| Nome | Idioma | Descrição | MCD | Recursos Extras |
|---|---|---|---|---|
| Niette | Português Brasileiro (pt) | Voz Feminina treinada usando o corpos CETUC | Completo: 2.26 (16hz-SPTK-4.3) - Trainamento/Teste(90/10): 4.615773 | Modelos SpamF0 e Phrasig |
| Pieroni | Português Brasileiro (pt) | Voz Masculina treinada usando o corpos THLS | Completo: 3.90 (48hz-SPTK-4.3) - Trainamento/Teste(90/10): 4.561331 | Modelo SpamF0 e Phrasig |
Observações
Para construção das vozes apenas foi feito usando todo o corpus, o MCD para treinamento e teste não foi obtidos devido a isso. Sendo MCD da versão antiga.
1.0.2-alpha
Adições:
Modelo G2P pode lidar com palavras com hifers (-), e também a palavras com ('), ignorando eles nas palavras.
Correções
Foi corrigido o erro que a voz Niette não processava números compostos por duas ou mais palavras.
Exemplo: 2020 (dois mil e vinte) = 2020 (dois)
Bugs Conhecidos
Bug relatado na versão anterior não foi corrigido e sem previa de resolução.
Vozes do NietteTTS
| Nome | Idioma | Descrição | MCD | Recursos Extras |
|---|---|---|---|---|
| Niette | Português Brasileiro (pt) | Voz Feminina treinada usando o corpos CETUC | Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 | Modelos SpamF0 e Phrasig |
| Pieroni | Português Brasileiro (pt) | Voz Masculina treinada usando o corpos THLS | Completo: 4.19 - Trainamento/Teste(90/10): 4.561331 | Modelo SpamF0 e Phrasig |
1.0.1-alpha
Para usar essas vozes no speech-dispatcher, é necessario instalar essa modificação do festival-freebsoft:
https://github.com/NietteLabs/festival-freebsoft-utils
Bug conhecido
A intonação feita usando o SpamF0, para uma voz especificar podem sobrepor a intonação de outro modelo.
Exemplo
Caso, use a voz Niette e depois escolher a voz Pieroni, o tom da voz Niette vai está na voz Pieroni e vise-vesa. Para resolver isso, é necessario reinicar a sessão.
Vozes do NietteTTS
| Nome | Idioma | Descrição | MCD | Recursos Extras |
|---|---|---|---|---|
| Niette | Português Brasileiro (pt) | Voz Feminina treinada usando o corpos CETUC | Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 | Modelos SpamF0 e Phrasig |
| Pieroni | Português Brasileiro (pt) | Voz Masculina treinada usando o corpos THLS | Completo: 4.19 - Trainamento/Teste(90/10): 4.561331 | Modelo SpamF0 e Phrasig |
Primeira versão do NietteTTS - Vozes Niette e Pieroni em pacote .deb
| Nome | Idioma | Descrição | MCD | Recursos Extras |
|---|---|---|---|---|
| Niette | Português Brasileiro (pt) | Voz Feminina treinada usando o corpos CETUC | Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 | Modelos SpamF0 e Phrasig |
| Pieroni | Português Brasileiro (pt) | Voz Masculina treinada usando o corpos THLS | Completo: 4.19 - Trainamento/Teste(90/10): 4.615773 | Modelo SpamF0 e Phrasig |