🤖 IA & Automação · · 4 min de leitura

Hugging Face Lança Modelo de Visão-Linguagem LFM2.5-VL-3B

Modelo de visão-linguagem mais capaz para hardware próprio.

ia automação visão-linguagem inteligência artificial
Ilustração para: Hugging Face Lança Modelo de Visão-Linguagem LFM2.5-VL-3B
Ilustração conceitual gerada por IA. Não retrata o fato descrito.

Publicidade

A Hugging Face anunciou o lançamento do modelo de visão-linguagem LFM2.5-VL-3B, que é considerado o mais capaz para ser executado em hardware próprio. Esse modelo entende documentos e telas, identifica objetos e pode chamar ferramentas, além de fornecer respostas diretas em tempo real e em aplicativos on-device. Com essa capacidade, o LFM2.5-VL-3B se destaca em sua categoria por sua eficiência e flexibilidade.

O LFM2.5-VL-3B apresenta quatro melhorias significativas em relação às versões anteriores, incluindo a combinação de um codificador de visão SigLIP2 400M NaFlex com o mesmo modelo de texto pré-treinado, além de ter sido pré-treinado em cerca de 34 trilhões de tokens, com quatro vezes mais dados de visão do que antes. Isso inclui conjuntos de imagens legendadas, OCR, fundamentação e seguimento de instruções. Além disso, o modelo suporta scripts não latinos, com um vocabulário estendido para 128 mil palavras.

A avaliação do modelo foi realizada em duas etapas: fine-tuning supervisionado e aprendizado de reforço multi-recompensa. Os benchmarks de visão abrangem compreensão visual multilíngue, seguimento de instruções, raciocínio matemático e científico, compreensão de documentos, detecção de objetos, compreensão de múltiplas imagens e compreensão de telas. O LFM2.5-VL-3B lidera sua categoria em tarefas de imagem do mundo real e também lê conteúdo digital com eficácia, desde documentos e gráficos até elementos de interface do usuário em telas.

Publicidade

Além disso, o modelo foi avaliado em benchmarks de texto apenas para seguimento de instruções e uso de ferramentas. O seguimento de instruções melhorou consistentemente, e o uso de ferramentas apresentou uma melhora acentuada. Em uso de ferramentas, o LFM2.5-VL-3B é comparável ao Gemma-4-E2B e Qwen3.5-2B.

Esses resultados demonstram que o LFM2.5-VL-3B é um modelo de visão-linguagem forte e de propósito geral. Ele cobre tarefas do dia a dia, como legendagem, resposta a perguntas visuais, compreensão de documentos, e é especialmente bom em fundamentar objetos, ler telas e documentos, e chamar ferramentas.

O LFM2.5-VL-3B é compatível com vários ecossistemas de inferência, incluindo llama.cpp, MLX, vLLM, SGLang e ONNX, e oferece suporte on-device com desempenho notável. Por exemplo, decodifica 228 tokens por segundo em um M5 Max e 116 tokens por segundo em um Ryzen AI Max+ 395, cabendo em cerca de 3 GB de memória. Além disso, alcança 20 tokens por segundo em um Galaxy S26 Ultra, permitindo sua execução completa on-device.

Em inferência de GPU, o LFM2.5-VL-3B mantém a latência consistentemente baixa e é o mais rápido em entradas de múltiplos quadros. Além disso, é o mais rápido em produção de saída, atingindo cerca de 11 mil tokens por segundo em alta concorrência, o que é aproximadamente duas vezes mais do que os modelos maiores da classe 4B e à frente até mesmo dos modelos menores da classe 2B.

Essas capacidades tornam o LFM2.5-VL-3B uma escolha ideal para inteligência on-device em cargas de trabalho de alto volume. Com ele, é possível alcançar um desempenho superior em tarefas que exigem compreensão de visão e linguagem, tornando-o uma ferramenta valiosa para desenvolvedores e empresas que buscam integrar inteligência artificial em seus produtos e serviços.

Para empresas brasileiras, o LFM2.5-VL-3B pode ser especialmente útil em setores como saúde, finanças e varejo, onde a capacidade de processar e entender grandes volumes de dados visuais e textuais é crucial. Com sua capacidade de ser executado on-device, o modelo pode ser integrado a aplicativos móveis e outros dispositivos, permitindo uma experiência de usuário mais interativa e personalizada.

Além disso, o LFM2.5-VL-3B pode ser utilizado em tarefas como análise de imagens médicas, detecção de fraudes em documentos e compreensão de comportamento do consumidor, entre outras. Com sua flexibilidade e desempenho, o modelo tem o potencial de revolucionar a forma como as empresas brasileiras abordam a inteligência artificial e a automação em seus processos.

Em resumo, o LFM2.5-VL-3B é um modelo de visão-linguagem poderoso e flexível que pode ser utilizado em uma variedade de aplicações, desde a compreensão de documentos e telas até a detecção de objetos e o uso de ferramentas. Com sua capacidade de ser executado on-device e sua compatibilidade com vários ecossistemas de inferência, o modelo é uma escolha ideal para empresas brasileiras que buscam integrar inteligência artificial em seus produtos e serviços.

Fontes

Esta análise é original do i-a-trend e foi elaborada a partir das reportagens publicadas pelas fontes acima, consultadas para apuração dos fatos. O crédito pela apuração é dos veículos citados — recomendamos a leitura das matérias originais.

Texto produzido com apoio de inteligência artificial e publicado sob responsabilidade editorial do i-a-trend. Encontrou um erro? Escreva para contato@i-a-trend.com.

Publicidade

Leia também

Receba as tendências de IA

As 10 melhores notícias de automação com IA toda semana no seu email.

Sem spam. Cancelamento a qualquer momento.