Google Lança Modelo de Transcrição de Voz Inteligente Gemini 3.5 Transcribe
Modelo de transcrição de voz mais preciso da Google.
Publicidade
A Google acaba de lançar o Gemini 3.5 Transcribe, seu modelo de transcrição de voz mais preciso e inteligente até o momento. Desenvolvido para interações de voz em tempo real, o Gemini 3.5 Transcribe supera os modelos convencionais de reconhecimento de voz, que geralmente têm dificuldades com ruídos de fundo, jargões complexos e limpeza de disfluências. Em vez disso, o Gemini 3.5 Transcribe converte áudio bruto diretamente em texto preciso, polido e formatado.
Essa tecnologia já está sendo utilizada em produtos como o aplicativo Gemini e no Android, onde os consumidores estão aproveitando novas capacidades de voz, como o Rambler no Android e no aplicativo Gemini no macOS. Agora, os desenvolvedores também podem criar capacidades semelhantes com o Gemini 3.5 Transcribe, por meio da API Gemini no Google AI Studio e na plataforma Gemini Enterprise Agent.
O modelo foi projetado para se integrar perfeitamente aos fluxos de trabalho dos desenvolvedores, seja para construir agentes de voz, ferramentas de legendagem em tempo real ou pipelines de análise pós-chamada. Além disso, o Gemini 3.5 Transcribe é capaz de capturar o estilo natural de fala para entender melhor a intenção e reconhecer vocabulário personalizado, permitindo que os usuários executem tarefas com a voz.
Publicidade
Uma das principais vantagens do Gemini 3.5 Transcribe é sua capacidade de lidar com mudanças de idioma ao vivo e transcrição de streaming sem interrupções. Além disso, o modelo entrega transcrição com atribuição de multi-falantes e timestamps de nível de palavra. Em termos de desempenho, o Gemini 3.5 Transcribe representa um grande avanço em relação ao modelo anterior, Chirp 3, oferecendo novas capacidades, taxas de erro de palavra melhoradas e latência significativamente reduzida.
De acordo com a Artificial Analysis, o tempo para transcrição final melhorou em 70% em comparação com o Chirp 3. Além disso, no benchmark FLEURS, o modelo entrega desempenho multilíngue preciso, melhorando em relação ao Chirp 3 e alcançando uma taxa de erro de palavra de 5,50% no modo de streaming e 5,04% nos casos de uso não em streaming.
A integração do Gemini 3.5 Transcribe com a API Gemini no Google AI Studio e na plataforma Gemini Enterprise Agent permite que os desenvolvedores criem interfaces de voz de alto desempenho com facilidade. Além disso, plataformas de desenvolvimento como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents também estão utilizando o Gemini Live API para permitir que os desenvolvedores construam e implantem interfaces de voz impulsionadas por alta performance.
Empresas como Vivo, Intellitek Health e Lingopal já compartilharam feedback positivo sobre o Gemini 3.5 Transcribe, destacando sua latência impressionante, precisão e suporte a idiomas amplo. Com o lançamento do Gemini 3.5 Transcribe, a Google está redefinindo o padrão para transcrição de voz inteligente e abrindo novas possibilidades para desenvolvedores e empresas que buscam criar experiências de voz inovadoras e precisas.
Fontes
Esta análise é original do i-a-trend e foi elaborada a partir das reportagens publicadas pelas fontes acima, consultadas para apuração dos fatos. O crédito pela apuração é dos veículos citados — recomendamos a leitura das matérias originais.
Texto produzido com apoio de inteligência artificial e publicado sob responsabilidade editorial do i-a-trend. Encontrou um erro? Escreva para contato@i-a-trend.com.
Publicidade
Leia também
Google Lança Lyria 3 Pro para Criação de Música Personalizada
Nova ferramenta de inteligência artificial para música
Google Desenvolve Tecnologia de Marca D'Água para Proteínas Criadas por IA
Tecnologia de marca d'água para proteínas criadas por IA preserva função biológica.
Cornerstone OnDemand reduz tempo de diagnóstico de banco de dados em 78%
Redução de tempo de diagnóstico de banco de dados com uso de inteligência artificial