A IBM anunciou a chegada da família Granite Speech 5.0 Turbo, composta por dois novos modelos de reconhecimento de voz desenhados para oferecer um equilíbrio otimizado entre precisão e velocidade. Com 470 milhões de parâmetros, estes modelos de arquitetura encoder-only destacam-se pela sua eficiência, sendo capazes de processar mais de 3,5 horas de áudio num único segundo quando operam em inferência por lotes. Esta capacidade técnica, testada em GPUs NVIDIA H200, representa um salto significativo em relação às iterações anteriores da série Granite, permitindo uma resposta mais célere em tarefas de transcrição.

Os dois modelos lançados, designados como granite-speech-5.0-470m-turboctc e a sua variante 'nc' (non-commercial), diferenciam-se essencialmente pela licença e pelos dados utilizados no treino. Enquanto a versão base é distribuída sob a licença Apache 2.0, a variante 'nc' recorre a um conjunto de dados mais vasto, o que se reflete num desempenho ligeiramente superior em testes de precisão. Segundo os dados divulgados, a versão não comercial obteve uma taxa de erro de palavras (WER) de 4,85%, comparativamente aos 5,00% registados pela versão de código aberto, conforme aferido pelo OpenASR Leaderboard.

A arquitetura destes modelos marca uma mudança estratégica face aos antecessores. Ao prescindir de componentes como a camada de linguagem (LM) com adaptadores LoRA, a IBM conseguiu reduzir a pegada de memória e aumentar o rendimento em mais de 20 vezes. Embora esta simplificação implique a perda de funcionalidades como a tradução de voz ou o enviesamento de palavras-chave, os modelos tornam-se ferramentas adequadas para aplicações de transcrição em tempo real em dispositivos de computação periférica, onde a eficiência de recursos é um fator determinante para a viabilidade operacional.

Tecnicamente, os modelos utilizam uma estrutura de 16 blocos Conformer, integrando mecanismos de auto-condicionamento e atenção por blocos para contornar as limitações de escalabilidade das arquiteturas tradicionais. Uma das inovações centrais reside na redução da taxa de tokens, que passou de 50 caracteres por segundo para 12,5 tokens por segundo. Este processo é suportado por três etapas de subamostragem temporal, que permitem converter a entrada de espectrogramas Mel em representações mais compactas sem comprometer a integridade da transcrição, mantendo a precisão necessária para o reconhecimento de voz.

Os resultados, validados pelo OpenASR Leaderboard, colocam estes modelos entre os mais rápidos do mercado. A IBM disponibilizou ainda uma demonstração baseada em WebGPU, permitindo aos utilizadores testar a capacidade de reconhecimento de voz em tempo real diretamente nos navegadores Chrome ou Edge. Esta abordagem sublinha o compromisso da empresa em disponibilizar soluções de inteligência artificial que, além de precisas, sejam viáveis para ambientes de produção exigentes e de baixa latência, consolidando a posição da série Granite no ecossistema de modelos de voz.

Porque importa

A introdução do Granite Speech 5.0 Turbo é relevante por demonstrar como a simplificação arquitetural pode desbloquear ganhos massivos de eficiência em tarefas de transcrição. Ao priorizar a velocidade e o baixo consumo de recursos, a IBM facilita a implementação de IA de voz em hardware limitado, reduzindo custos operacionais e latência em aplicações críticas de processamento de áudio.

Fontes

Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTCHugging Face ↗