A Hcompany revelou o NeoMME, uma nova família de codificadores multimodais e multilingues, disponível em versões de 260 milhões e 800 milhões de parâmetros. Ao contrário da tendência atual, que recorre a modelos de linguagem generativos adaptados, o NeoMME distingue-se por não utilizar torres de visão ou descodificadores causais pré-treinados. A arquitetura baseia-se num único Transformer bidirecional que processa texto e imagens, treinado de raiz através de um objetivo de difusão discreta mascarada.
O design do NeoMME foi otimizado para tarefas de recuperação de documentos visuais, utilizando uma abordagem de página-imagem. A estrutura permite que o modelo gere embeddings densos e de interação tardia numa única passagem, demonstrando um desempenho competitivo em termos de tamanho e precisão. Segundo os dados técnicos, ambos os modelos posicionam-se na fronteira de Pareto do benchmark ViDoRe v3, equilibrando a métrica nDCG@10 com a dimensão computacional do sistema.
Um dos pontos fortes desta arquitetura é a sua eficiência operacional. Com uma entrada de imagem de 2048×2048 píxeis num GPU NVIDIA L40S, a variante de 260 milhões de parâmetros consegue processar cerca de 51 páginas por segundo, duplicando o débito de soluções anteriores como o ColModernVBERT. Além disso, a implementação de técnicas de pooling hierárquico de tokens e quantização assimétrica permite reduzir o armazenamento do índice de interação tardia, passando de 1,5 MB para 6 kB por página, mantendo 95% da eficácia original.
A arquitetura do NeoMME incorpora inovações recentes, incluindo atenção de consulta agrupada, normalização de consulta-chave e embeddings de posição rotativa 2D. A capacidade de lidar com resoluções dinâmicas de imagem, mantendo o rácio de aspeto original, permite que o modelo aloque mais tokens a documentos densos em informação. Com uma janela de contexto de 16.384 tokens, o sistema é capaz de processar até duas imagens em resolução 4K UHD, facilitando a análise de documentos complexos.
O processo de pré-treino utiliza uma estratégia de denotificação de texto mascarado, onde a corrupção de tokens força o modelo a aprender representações fundamentadas na evidência visual das imagens. Ao remover atalhos baseados apenas na linguagem, o sistema é incentivado a integrar sinais visuais de forma mais robusta. O projeto, disponível na plataforma Hugging Face sob a licença Apache 2.0, representa um passo na simplificação de arquiteturas multimodais para aplicações de recuperação de informação e RAG visual.
Porque importa
O NeoMME é relevante por demonstrar que é possível obter um desempenho de topo em recuperação visual sem a complexidade e o custo computacional dos modelos multimodais generativos. Ao simplificar a arquitetura para um único Transformer bidirecional, a Hcompany oferece uma solução mais leve e rápida, ideal para ambientes de produção onde a latência e a eficiência de armazenamento são fatores críticos para a escalabilidade de sistemas de RAG visual.