Hugging Face Lança Modelo de Visão-Linguagem LFM2.5-VL-3B
Modelo de visão-linguagem mais capaz para hardware próprio.
Publicidade
A Hugging Face anunciou o lançamento do modelo de visão-linguagem LFM2.5-VL-3B, que é considerado o mais capaz para ser executado em hardware próprio. Esse modelo entende documentos e telas, identifica objetos e pode chamar ferramentas, além de fornecer respostas diretas em tempo real e em aplicativos on-device. Com essa capacidade, o LFM2.5-VL-3B se destaca em sua categoria por sua eficiência e flexibilidade.
O LFM2.5-VL-3B apresenta quatro melhorias significativas em relação às versões anteriores, incluindo a combinação de um codificador de visão SigLIP2 400M NaFlex com o mesmo modelo de texto pré-treinado, além de ter sido pré-treinado em cerca de 34 trilhões de tokens, com quatro vezes mais dados de visão do que antes. Isso inclui conjuntos de imagens legendadas, OCR, fundamentação e seguimento de instruções. Além disso, o modelo suporta scripts não latinos, com um vocabulário estendido para 128 mil palavras.
A avaliação do modelo foi realizada em duas etapas: fine-tuning supervisionado e aprendizado de reforço multi-recompensa. Os benchmarks de visão abrangem compreensão visual multilíngue, seguimento de instruções, raciocínio matemático e científico, compreensão de documentos, detecção de objetos, compreensão de múltiplas imagens e compreensão de telas. O LFM2.5-VL-3B lidera sua categoria em tarefas de imagem do mundo real e também lê conteúdo digital com eficácia, desde documentos e gráficos até elementos de interface do usuário em telas.
Publicidade
Além disso, o modelo foi avaliado em benchmarks de texto apenas para seguimento de instruções e uso de ferramentas. O seguimento de instruções melhorou consistentemente, e o uso de ferramentas apresentou uma melhora acentuada. Em uso de ferramentas, o LFM2.5-VL-3B é comparável ao Gemma-4-E2B e Qwen3.5-2B.
Esses resultados demonstram que o LFM2.5-VL-3B é um modelo de visão-linguagem forte e de propósito geral. Ele cobre tarefas do dia a dia, como legendagem, resposta a perguntas visuais, compreensão de documentos, e é especialmente bom em fundamentar objetos, ler telas e documentos, e chamar ferramentas.
O LFM2.5-VL-3B é compatível com vários ecossistemas de inferência, incluindo llama.cpp, MLX, vLLM, SGLang e ONNX, e oferece suporte on-device com desempenho notável. Por exemplo, decodifica 228 tokens por segundo em um M5 Max e 116 tokens por segundo em um Ryzen AI Max+ 395, cabendo em cerca de 3 GB de memória. Além disso, alcança 20 tokens por segundo em um Galaxy S26 Ultra, permitindo sua execução completa on-device.
Em inferência de GPU, o LFM2.5-VL-3B mantém a latência consistentemente baixa e é o mais rápido em entradas de múltiplos quadros. Além disso, é o mais rápido em produção de saída, atingindo cerca de 11 mil tokens por segundo em alta concorrência, o que é aproximadamente duas vezes mais do que os modelos maiores da classe 4B e à frente até mesmo dos modelos menores da classe 2B.
Essas capacidades tornam o LFM2.5-VL-3B uma escolha ideal para inteligência on-device em cargas de trabalho de alto volume. Com ele, é possível alcançar um desempenho superior em tarefas que exigem compreensão de visão e linguagem, tornando-o uma ferramenta valiosa para desenvolvedores e empresas que buscam integrar inteligência artificial em seus produtos e serviços.
Para empresas brasileiras, o LFM2.5-VL-3B pode ser especialmente útil em setores como saúde, finanças e varejo, onde a capacidade de processar e entender grandes volumes de dados visuais e textuais é crucial. Com sua capacidade de ser executado on-device, o modelo pode ser integrado a aplicativos móveis e outros dispositivos, permitindo uma experiência de usuário mais interativa e personalizada.
Além disso, o LFM2.5-VL-3B pode ser utilizado em tarefas como análise de imagens médicas, detecção de fraudes em documentos e compreensão de comportamento do consumidor, entre outras. Com sua flexibilidade e desempenho, o modelo tem o potencial de revolucionar a forma como as empresas brasileiras abordam a inteligência artificial e a automação em seus processos.
Em resumo, o LFM2.5-VL-3B é um modelo de visão-linguagem poderoso e flexível que pode ser utilizado em uma variedade de aplicações, desde a compreensão de documentos e telas até a detecção de objetos e o uso de ferramentas. Com sua capacidade de ser executado on-device e sua compatibilidade com vários ecossistemas de inferência, o modelo é uma escolha ideal para empresas brasileiras que buscam integrar inteligência artificial em seus produtos e serviços.
Fontes
Esta análise é original do i-a-trend e foi elaborada a partir das reportagens publicadas pelas fontes acima, consultadas para apuração dos fatos. O crédito pela apuração é dos veículos citados — recomendamos a leitura das matérias originais.
Texto produzido com apoio de inteligência artificial e publicado sob responsabilidade editorial do i-a-trend. Encontrou um erro? Escreva para contato@i-a-trend.com.
Publicidade
Leia também
Datacor Implementa Análise de Aluguel com Amazon Quick Sight
Datacor melhora análise de aluguel com Amazon Quick Sight
Google Lança Gemma 4, Modelo de IA Mais Avançado
Gemma 4: modelo de IA mais inteligente e acessível da Google.
Lançamento do Gemini 3.8 Live com Live Avatar
Nova tecnologia de IA para interações mais naturais