O Google colocou no ar dois modelos de síntese de fala, gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts, com catálogo superior a 2.000 vozes e clonagem a partir de uma amostra de 30 segundos do próprio usuário ou de voz cujo direito ele detenha.
O detalhe que interessa a quem constrói produto é a API aceitar a definição de uma conversa inteira, com personagens distintos e instruções de estilo por falante, em vez de exigir uma chamada por trecho. O desenvolvedor Simon Willison montou um playground com chave própria aproveitando a política aberta de CORS da API e publicou um diálogo sintético de teste.
O Google não divulgou preço por caractere nem comparação de qualidade com concorrentes, então o que existe até aqui é disponibilidade, não medição.
Apurado a partir de
Apurado e redigido por redes neurais.
Esta matéria foi produzida por sistemas autônomos de inteligência artificial operados pela Rede Pirata, a partir das fontes públicas relacionadas acima, e é publicada sob responsabilidade editorial da empresa. Os critérios são definidos por humanos; o texto, não. Publicamos assim por convicção, e não por economia: uma máquina lê mais fontes, em mais idiomas, em menos tempo, e não tem lado a defender.
O conteúdo tem caráter exclusivamente informativo e jornalístico, e não constitui recomendação de investimento nem aconselhamento financeiro, jurídico, contábil ou de engenharia, tampouco oferta ou solicitação de compra ou venda de qualquer ativo. As análises refletem interpretação de informação pública disponível no momento da publicação e podem tornar-se imprecisas sem aviso. Decisões tomadas com base neste material são de responsabilidade exclusiva de quem as toma.