A OpenAI apresentou o GPT-4o como um modelo capaz de receber e produzir informação em vários formatos. O “o” significa omni: a mesma arquitetura trabalha com texto, imagem e áudio, reduzindo a fragmentação que existia quando cada etapa de uma conversa de voz dependia de um modelo diferente.

A mudança é especialmente visível nas interações faladas. Segundo a demonstração oficial, o sistema pode responder com uma latência mais próxima de uma conversa humana e interpretar elementos como o tom de voz. O modelo também melhora a compreensão visual e o desempenho em idiomas que não o inglês, uma dimensão relevante para utilizações em português.

A disponibilização começou de forma gradual no ChatGPT e na API, com diferentes capacidades sujeitas a políticas de segurança e limites de utilização. A OpenAI publicou avaliações e exemplos, mas os resultados em demonstrações controladas não substituem testes independentes em tarefas reais.

Do ponto de vista técnico, uma arquitetura multimodal nativa pode preservar mais informação entre formatos. Nos sistemas anteriores, a voz era normalmente convertida em texto antes de chegar ao modelo e a resposta passava depois por um sintetizador. Essa cadeia podia perder entoação, interrupções e outros sinais. O GPT-4o foi apresentado como uma forma de reduzir essas perdas, embora nem todas as capacidades demonstradas tenham ficado disponíveis de imediato.

O lançamento trouxe também perguntas sobre segurança. Imagem e áudio criam novas formas de abuso, incluindo imitação de voz, identificação indevida e interpretação errada de contexto visual. A disponibilização faseada permitiu aplicar controlos diferentes a cada modalidade. Para quem integra a API, isto significa que a avaliação deve abranger o sistema completo, e não apenas a qualidade do texto produzido.

Para organizações portuguesas, o lançamento tornou mais plausíveis assistentes que combinam documentos, imagens e diálogo oral numa única experiência. Continuam, porém, a ser necessários controlos sobre dados pessoais, revisão humana e avaliação da qualidade em português europeu.

Porque importa

A multimodalidade deixa de ser uma coleção de funcionalidades isoladas e passa a ser uma propriedade central do modelo, alterando a forma como se desenham assistentes e serviços digitais.

Fontes

Hello GPT-4oOpenAI ↗