A Google DeepMind anunciou o lançamento do Gemini 3.5 Transcribe, um modelo de inteligência artificial especializado na conversão de voz para texto. Esta solução foi desenhada para superar as limitações dos sistemas de reconhecimento de fala convencionais, que frequentemente apresentam dificuldades em ambientes com ruído de fundo, terminologia técnica complexa ou disfluências na fala. Segundo a empresa, o modelo consegue transformar áudio bruto em texto formatado e polido de forma direta, melhorando a qualidade da transcrição final.
O Gemini 3.5 Transcribe destaca-se pela sua capacidade de processamento inteligente, sendo capaz de remover automaticamente palavras de preenchimento e de corrigir erros de auto-correção cometidos pelo orador durante o discurso. Além disso, o sistema integra funcionalidades de formatação automática e reconhecimento de vocabulário personalizado, permitindo uma adaptação mais eficaz a contextos profissionais específicos. A tecnologia já está a ser implementada em produtos de consumo da marca, incluindo a aplicação Gemini para macOS e novas funcionalidades de voz no sistema operativo Android.
Para os programadores, a Google disponibilizou o modelo através de duas interfaces de programação distintas no Google AI Studio e na Gemini Enterprise Agent Platform. A primeira opção, designada por 'gemini-3.5-transcribe-live', foca-se no streaming contínuo em tempo real, oferecendo latência inferior a um segundo para aplicações interativas. A segunda, 'gemini-3.5-transcribe', é otimizada para o processamento de áudio pré-gravado, como reuniões ou registos de chamadas, incluindo capacidades avançadas de atribuição de oradores e marcações temporais ao nível da palavra.
No que diz respeito ao desempenho técnico, dados da Artificial Analysis indicam que o modelo atinge uma taxa de erro de palavras (WER) de 4,0% em cenários de streaming e de 2,6% em casos de utilização com áudio pré-gravado. Estes resultados demonstram uma robustez elevada em ambientes ruidosos e uma precisão na captura de entidades alfanuméricas, como códigos postais ou identificadores de encomendas, elementos que tradicionalmente desafiam os sistemas de transcrição automática.
A integração do modelo permite ainda a utilização de 'function calling', possibilitando que o sistema delegue tarefas complexas, como a análise de ficheiros ou a geração de imagens, a outros modelos da família Gemini. Esta funcionalidade visa criar fluxos de trabalho mais eficientes para quem desenvolve agentes de voz ou ferramentas de legendagem automática. Com este lançamento, a Google reforça a sua aposta na inteligência áudio, procurando oferecer uma ferramenta mais versátil para o ecossistema de desenvolvimento de software.
Porque importa
O lançamento do Gemini 3.5 Transcribe representa um avanço na precisão da transcrição automática, reduzindo a necessidade de edição manual em contextos profissionais. Ao disponibilizar APIs de baixa latência, a Google facilita a criação de agentes de voz mais inteligentes e capazes de compreender intenções complexas, impactando setores como o atendimento ao cliente e a análise de dados de voz.