Skip to content

1.0.4-alpha

Pre-release
Pre-release

Choose a tag to compare

@Pallas13 Pallas13 released this 02 Sep 13:28
· 30 commits to main since this release

Português Brasileiro

Informações gerais

Fonemas: Lista de Fonemas Usadas, formato IPA retiradas do projeto WikiPron

Dicionario: Dicionario, fornecido pelo projeto WikiPron

Foi usando REAPER para extração de F0 para
Extração de MCEP SPTK-4.3. Na extração de MCEP foram usados como base o artigo Simple Methods for Improving Speaker-Similarity of HMM-Based Speech Synthesis - Junichi Yamagishi, Simon King para valores de MCEP Order e Alpha para melhor extração para as vozes de 16hz e 44hz. Script para extração de STR do MaryTTS foi usando para extração de STR das vozes.

Valores usados:

Sample Rate MCEP Order Alpha
16000hz 49 0.42
44000hz 68 0.713969

Vozes

Nome Corpus usando Descrição MCD
Ana CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F050 3.80
Paula CETUC O Centro de Estudos em Telecomunicações (CETUC), através do Professor Doutor Abraham Alcaim, gentilmente cedeu ao LaPS, para fins de pesquisa exclusivamente, seu corpus de áudio para Português Brasileiro. Esse corpus, é composto por áudios de 1.000 sentenças, gravados por 101 locutores, totalizando aproximadamente 143 horas de áudio. Locutor ID: F000 3.90
Pieroni THLS Open Source Brazilian Portuguese Speech Dataset with 1000 sentences balanced phonetically. (Feito downgrade de 48hz para 44hz) 3,72

Para mais informações como amostras de aúdios das vozes, visite a página de suporte do idioma pt-br do NietteTTS Clique aqui para acessar

Alterações

  1. Voz Niette foi renomeada como Ana e refeita usando as informações acima;

  2. Nova Voz Adicionada (Paula):

    1. Voz feminina usando o corpus CETUC.
  3. Foi modificado o script festvox/setup.sh das vozes.

    1. Agora, caso o modelo g2p for usado, a palavra gerada será armazernada no dicionario global do idioma LANG do NietteTTS a nível de usuário .local/share/niettetts/dics/niettelabs_$LANG_addenda.scm.
      1. Economizará processamento, evitando o uso do modelo G2P para palavras que foram pré-processandas.

Edit 24/09/2025

Valores da função proclaim_voice da voz Pieroni, estavam sendo duplicandos para as vozes restantes com isso Speech Dispatcher não fazia reconhecimento das outras vozes. Extensão dos pacotes corrigidas adicionando .deb para APT fazer a instalação corretamente. Script festvox/g2p.h, foi atualizado com a alteração do ultimo commit.

Full Changelog: 1.0.3-alpha...1.0.4-alpha