🤖 IA & Automação · · 3 min de leitura

Google Lança Modelo de Transcrição de Voz Inteligente Gemini 3.5 Transcribe

Modelo de transcrição de voz mais preciso da Google.

ia automação transcrição de voz
Ilustração para: Google Lança Modelo de Transcrição de Voz Inteligente Gemini 3.5 Transcribe
Ilustração conceitual gerada por IA. Não retrata o fato descrito.

Publicidade

A Google acaba de lançar o Gemini 3.5 Transcribe, seu modelo de transcrição de voz mais preciso e inteligente até o momento. Desenvolvido para interações de voz em tempo real, o Gemini 3.5 Transcribe supera os modelos convencionais de reconhecimento de voz, que geralmente têm dificuldades com ruídos de fundo, jargões complexos e limpeza de disfluências. Em vez disso, o Gemini 3.5 Transcribe converte áudio bruto diretamente em texto preciso, polido e formatado.

Essa tecnologia já está sendo utilizada em produtos como o aplicativo Gemini e no Android, onde os consumidores estão aproveitando novas capacidades de voz, como o Rambler no Android e no aplicativo Gemini no macOS. Agora, os desenvolvedores também podem criar capacidades semelhantes com o Gemini 3.5 Transcribe, por meio da API Gemini no Google AI Studio e na plataforma Gemini Enterprise Agent.

O modelo foi projetado para se integrar perfeitamente aos fluxos de trabalho dos desenvolvedores, seja para construir agentes de voz, ferramentas de legendagem em tempo real ou pipelines de análise pós-chamada. Além disso, o Gemini 3.5 Transcribe é capaz de capturar o estilo natural de fala para entender melhor a intenção e reconhecer vocabulário personalizado, permitindo que os usuários executem tarefas com a voz.

Publicidade

Uma das principais vantagens do Gemini 3.5 Transcribe é sua capacidade de lidar com mudanças de idioma ao vivo e transcrição de streaming sem interrupções. Além disso, o modelo entrega transcrição com atribuição de multi-falantes e timestamps de nível de palavra. Em termos de desempenho, o Gemini 3.5 Transcribe representa um grande avanço em relação ao modelo anterior, Chirp 3, oferecendo novas capacidades, taxas de erro de palavra melhoradas e latência significativamente reduzida.

De acordo com a Artificial Analysis, o tempo para transcrição final melhorou em 70% em comparação com o Chirp 3. Além disso, no benchmark FLEURS, o modelo entrega desempenho multilíngue preciso, melhorando em relação ao Chirp 3 e alcançando uma taxa de erro de palavra de 5,50% no modo de streaming e 5,04% nos casos de uso não em streaming.

A integração do Gemini 3.5 Transcribe com a API Gemini no Google AI Studio e na plataforma Gemini Enterprise Agent permite que os desenvolvedores criem interfaces de voz de alto desempenho com facilidade. Além disso, plataformas de desenvolvimento como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents também estão utilizando o Gemini Live API para permitir que os desenvolvedores construam e implantem interfaces de voz impulsionadas por alta performance.

Empresas como Vivo, Intellitek Health e Lingopal já compartilharam feedback positivo sobre o Gemini 3.5 Transcribe, destacando sua latência impressionante, precisão e suporte a idiomas amplo. Com o lançamento do Gemini 3.5 Transcribe, a Google está redefinindo o padrão para transcrição de voz inteligente e abrindo novas possibilidades para desenvolvedores e empresas que buscam criar experiências de voz inovadoras e precisas.

Fontes

Esta análise é original do i-a-trend e foi elaborada a partir das reportagens publicadas pelas fontes acima, consultadas para apuração dos fatos. O crédito pela apuração é dos veículos citados — recomendamos a leitura das matérias originais.

Texto produzido com apoio de inteligência artificial e publicado sob responsabilidade editorial do i-a-trend. Encontrou um erro? Escreva para contato@i-a-trend.com.

Publicidade

Leia também

Receba as tendências de IA

As 10 melhores notícias de automação com IA toda semana no seu email.

Sem spam. Cancelamento a qualquer momento.