Skip to content

Releases: PallasSpeechSystem/Fest-TTS

1.0.5-alpha

1.0.5-alpha Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 18 Nov 16:03

Vozes

Nome Corpus usando Descrição MCD
Ana CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 3.80
Paula CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 3.90
Pieroni THLS Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) 5.92

Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar

Alterações

  1. O modelo g2p foi atualizado para nova versão do Phonetisaurus.
  2. Qualidade da voz Pieroni foi atualizada para 48Khz.

Full Changelog: 1.0.4-alpha...1.0.5-alpha

1.0.4-alpha

1.0.4-alpha Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 02 Sep 13:28

Português Brasileiro

Informações gerais

Fonemas: Lista de Fonemas Usadas, formato IPA retiradas do projeto WikiPron

Dicionario: Dicionario, fornecido pelo projeto WikiPron

Foi usando REAPER para extração de F0 para
Extração de MCEP SPTK-4.3. Na extração de MCEP foram usados como base o artigo Simple Methods for Improving Speaker-Similarity of HMM-Based Speech Synthesis - Junichi Yamagishi, Simon King para valores de MCEP Order e Alpha para melhor extração para as vozes de 16hz e 44hz. Script para extração de STR do MaryTTS foi usando para extração de STR das vozes.

Valores usados:

Sample Rate MCEP Order Alpha
16000hz 49 0.42
44000hz 68 0.713969

Vozes

Nome Corpus usando Descrição MCD
Ana CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 3.80
Paula CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 3.90
Pieroni THLS Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) 3,72

Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar

Alterações

  1. Voz Niette foi renomeada como Ana e refeita usando as informações acima;

  2. Nova Voz Adicionada (Paula):

    1. Voz feminina usando o corpus CETUC.
  3. Foi modificado o script festvox/setup.sh das vozes.

    1. Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
      1. Economizará processamento, evitando o uso do modelo G2P para palavras que foram pré-processandas.

Edit 24/09/2025

Valores da função proclaim_voice da voz Pieroni, estavam sendo duplicandos para as vozes restantes com isso Speech Dispatcher não fazia reconhecimento das outras vozes. Extensão dos pacotes corrigidas adicionando .deb para APT fazer a instalação corretamente. Script festvox/g2p.h, foi atualizado com a alteração do ultimo commit.

Full Changelog: 1.0.3-alpha...1.0.4-alpha

1.0.3-alpha

1.0.3-alpha Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 24 Jul 16:05

Novidades

  1. As vozes Pieroni e Niette foram construídos agora usado SPTK-4.3 para extração de MCEP veja o script $NIETTETTS_DEV/festvox_script/get_mcep_delta_sptk
  2. Voz Pieroni qualidade foi aumentada de 16hz para 48hz.

Bugs corregidos

Nenhum bug foi corrigido nessa versão.

Vozes do NietteTTS

Nome Idioma Descrição MCD Recursos Extras
Niette Português Brasileiro (pt) Voz Feminina treinada usando o corpos CETUC Completo: 2.26 (16hz-SPTK-4.3) - Trainamento/Teste(90/10): 4.615773 Modelos SpamF0 e Phrasig
Pieroni Português Brasileiro (pt) Voz Masculina treinada usando o corpos THLS Completo: 3.90 (48hz-SPTK-4.3) - Trainamento/Teste(90/10): 4.561331 Modelo SpamF0 e Phrasig

Observações

Para construção das vozes apenas foi feito usando todo o corpus, o MCD para treinamento e teste não foi obtidos devido a isso. Sendo MCD da versão antiga.

1.0.2-alpha

1.0.2-alpha Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 14 Jul 12:56

Adições:

Modelo G2P pode lidar com palavras com hifers (-), e também a palavras com ('), ignorando eles nas palavras.

Correções

Foi corrigido o erro que a voz Niette não processava números compostos por duas ou mais palavras.
Exemplo: 2020 (dois mil e vinte) = 2020 (dois)

Bugs Conhecidos

Bug relatado na versão anterior não foi corrigido e sem previa de resolução.

Vozes do NietteTTS

Nome Idioma Descrição MCD Recursos Extras
Niette Português Brasileiro (pt) Voz Feminina treinada usando o corpos CETUC Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 Modelos SpamF0 e Phrasig
Pieroni Português Brasileiro (pt) Voz Masculina treinada usando o corpos THLS Completo: 4.19 - Trainamento/Teste(90/10): 4.561331 Modelo SpamF0 e Phrasig

1.0.1-alpha

1.0.1-alpha Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 12 Jul 00:53

Para usar essas vozes no speech-dispatcher, é necessario instalar essa modificação do festival-freebsoft:
https://github.com/NietteLabs/festival-freebsoft-utils

Bug conhecido

A intonação feita usando o SpamF0, para uma voz especificar podem sobrepor a intonação de outro modelo.

Exemplo

Caso, use a voz Niette e depois escolher a voz Pieroni, o tom da voz Niette vai está na voz Pieroni e vise-vesa. Para resolver isso, é necessario reinicar a sessão.

Vozes do NietteTTS

Nome Idioma Descrição MCD Recursos Extras
Niette Português Brasileiro (pt) Voz Feminina treinada usando o corpos CETUC Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 Modelos SpamF0 e Phrasig
Pieroni Português Brasileiro (pt) Voz Masculina treinada usando o corpos THLS Completo: 4.19 - Trainamento/Teste(90/10): 4.561331 Modelo SpamF0 e Phrasig

Primeira versão do NietteTTS - Vozes Niette e Pieroni em pacote .deb

Choose a tag to compare

@Pallas13 Pallas13 released this 09 Jul 18:20
Nome Idioma Descrição MCD Recursos Extras
Niette Português Brasileiro (pt) Voz Feminina treinada usando o corpos CETUC Completo: 4.05 - Trainamento/Teste(90/10): 4.615773 Modelos SpamF0 e Phrasig
Pieroni Português Brasileiro (pt) Voz Masculina treinada usando o corpos THLS Completo: 4.19 - Trainamento/Teste(90/10): 4.615773 Modelo SpamF0 e Phrasig