A LiquidAI anunciou o lançamento do LFM2.5-VL-3B, um modelo de visão e linguagem concebido especificamente para operar de forma eficiente em hardware local, ou dispositivos edge. Esta nova iteração foca-se em oferecer respostas rápidas e diretas, privilegiando a execução em tempo real em vez de processos de raciocínio complexos. Segundo a empresa, o modelo foi desenhado para compreender documentos, interpretar elementos de interfaces digitais e realizar tarefas de deteção de objetos com maior precisão do que as versões anteriores.
O desenvolvimento do LFM2.5-VL-3B baseou-se na integração de um codificador de visão SigLIP2 400M NaFlex com a arquitetura do modelo de texto LFM2.5-2.6B. O processo de treino envolveu a utilização de cerca de 34 biliões de tokens, com um aumento significativo na quantidade de dados visuais, incluindo conjuntos de dados sintéticos e curados de legendagem, OCR e seguimento de instruções. Para garantir uma maior versatilidade linguística, a equipa expandiu o vocabulário do tokenizador para 128 mil entradas, permitindo um melhor suporte a scripts não latinos sem a necessidade de um treino integral de raiz.
A estratégia de pós-treino do modelo dividiu-se em duas fases distintas. Inicialmente, foi aplicado um ajuste fino supervisionado, que incorporou técnicas de destilação de conhecimento a partir de modelos maiores e a metodologia de treino denominada Antidoom. Posteriormente, o modelo passou por um processo de aprendizagem por reforço com múltiplas recompensas. Estas etapas visam otimizar a capacidade de resposta do sistema em cenários práticos, como a chamada de funções e a interação multimodal, onde a precisão na interpretação de texto e imagem é crítica.
Nos testes de desempenho realizados pela LiquidAI, o LFM2.5-VL-3B demonstrou resultados competitivos na sua classe de tamanho, destacando-se particularmente em tarefas de compreensão de ecrãs e deteção de objetos através de consultas em linguagem natural. Em benchmarks como o ScreenSpot-v2, o modelo apresentou uma melhoria substancial face à versão anterior, evidenciando uma capacidade superior para interpretar elementos de interfaces gráficas em ambientes desktop, móveis e web, mantendo uma latência reduzida durante a inferência.
Além das capacidades visuais, o modelo apresenta avanços na utilização de ferramentas e na execução de funções, tanto em contextos puramente textuais como em situações multimodais. A empresa sublinha que o LFM2.5-VL-3B foi otimizado para responder diretamente, evitando o raciocínio intermediário, o que o torna uma solução viável para aplicações que exigem uma resposta imediata. O modelo já se encontra disponível para implementação, com suporte para execução em CPU e GPU, visando preencher a lacuna entre a complexidade dos modelos de grande escala e as limitações de hardware local.
Porque importa
A capacidade de executar modelos multimodais complexos diretamente no dispositivo, sem depender de servidores na nuvem, é fundamental para a privacidade e para a viabilidade de aplicações de IA em tempo real. O LFM2.5-VL-3B representa um passo importante na democratização de ferramentas de visão computacional eficientes para hardware com recursos limitados.