A Liquid AI lança o modelo LFM2.5-350M para loops agentivos

Novo modelo pequeno da Liquid AI para fluxos de trabalho de agentes
A Liquid AI lançou o LFM2.5-350M, um modelo de 350 milhões de parâmetros especificamente treinado para loops agentivos. Este modelo foca na extração confiável de dados e no uso de ferramentas, tornando-o adequado para ambientes onde computação, memória e latência são limitadas.
Especificações técnicas
- Tamanho: Menos de 500MB quando quantizado
- Treinamento: Treinado em 28 trilhões de tokens com aprendizado por reforço escalonado
- Desempenho: Supera modelos maiores como o Qwen3.5-0.8B na maioria dos benchmarks
- Eficiência: Significativamente mais rápido e eficiente em memória do que modelos comparáveis
Principais características
- Executa em CPUs, GPUs e hardware móvel
- Operação rápida, eficiente e de baixa latência
- Chamada de função confiável e fluxos de trabalho de agentes
- Saídas estruturadas consistentes
Disponibilidade
O checkpoint do modelo está disponível no Hugging Face em LiquidAI/LFM2.5-350M. Isso o torna acessível para testes imediatos e integração em fluxos de trabalho existentes.
Para desenvolvedores que trabalham com agentes de codificação de IA em ambientes com recursos limitados, este modelo oferece um equilíbrio entre capacidade e eficiência. O tamanho pequeno combinado com um forte desempenho em saídas estruturadas o torna prático para implantação na borda e aplicações móveis.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Claude Code v2.1.122 Adiciona Nível de Serviço Bedrock, Corrige Descoberta de Ferramentas MCP e Modo Bash
A CLI Claude Code v2.1.122 da Anthropic introduz seleção de nível de serviço Bedrock via variável de ambiente, corrige a descoberta de ferramentas MCP no modo não bloqueante, resolve o comportamento de saída do modo bash e corrige vários problemas de integração com Vertex AI / Bedrock.

Sistemas Multiagentes: Fluxos de Trabalho de Engenharia vs. Inteligência Emergente
Uma análise de um desenvolvedor argumenta que os sistemas multiagente atuais, como LangGraph e fluxos de trabalho AutoGen, funcionam mais como microsserviços com wrappers de LLM, fornecendo decomposição de tarefas, paralelização e modularidade, em vez de verdadeira inteligência emergente.

Degradação da Qualidade do Contexto em Agentes de IA: Taxas de Alucinação Aumentam com a Contagem de Tokens
Testes mostram que as taxas de alucinação aumentam de ~3% em 10K tokens para ~28% em 200K tokens, com a precisão de recuperação caindo abaixo de 90% para informações do início da sessão quando o contexto excede 50K tokens.

Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw
Testes mostram que o Qwen3.5-27B-FP8 pode executar seis agentes OpenClaw simultaneamente com a taxa de transferência escalando para 120 tokens/segundo. O framework SGLang com cache de prefixo reduz o pré-preenchimento de contexto de 100K de 10 segundos para 200ms.