Interfaze: Nova Arquitetura de Modelo Supera Gemini-3-Flash e GPT-5.4-Mini em Tarefas Determinísticas

Interfaze é uma nova arquitetura de modelo da Interfaze que mescla modelos DNN/CNN específicos de tarefa com omni-transformers, visando tarefas determinísticas de alta precisão em escala. Oferece uma janela de contexto de 1 milhão de tokens, máximo de 32 mil tokens de saída e suporta entradas de texto, imagens, áudio e arquivos com raciocínio opcional.
Resultados dos Benchmarks
De acordo com seus benchmarks, o Interfaze lidera contra modelos de faixa de preço similar (modelos Flash/mini como Gemini-3-Flash, GPT-5.4-Mini, Claude Sonnet 4.6 e Grok-4.3) em 9 testes comparativos:
- OCRBench V2: Interfaze 70,7% vs Gemini-3-Flash 55,8%, Claude-Sonnet-4.6 54,7%, GPT-5.4-Mini 52,7%, Grok-4.3 54,7%
- olmOCR: Interfaze 85,7% vs Gemini-3-Flash 75,3%, Claude-Sonnet-4.6 73,9%, GPT-5.4-Mini 80,1%, Grok-4.3 81,9%
- RefCOCO: Interfaze 82,1% vs Gemini-3-Flash 75,2%, Claude-Sonnet-4.6 75,5%, GPT-5.4-Mini 67,0%, Grok-4.3 25,0%
- VoxPopuli (WER, menor é melhor): Interfaze 2,4% vs Gemini-3-Flash 4,0%
- Spider 2.0-Lite: Interfaze 52,9% vs Gemini-3-Flash 45,2%, Claude-Sonnet-4.6 49,6%, GPT-5.4-Mini 26,7%, Grok-4.3 45,9%
- GPQA Diamond: Interfaze 89,9% vs Gemini-3-Flash 88,5%, Claude-Sonnet-4.6 89,9%, GPT-5.4-Mini 82,8%, Grok-4.3 73,6%
- MMMLU: Interfaze 90,9% vs Gemini-3-Flash 88,7%, Claude-Sonnet-4.6 84,9%, GPT-5.4-Mini 75,3%, Grok-4.3 89,7%
- MMMU-Pro: Interfaze 71,1% vs Gemini-3-Flash 67,6%, Claude-Sonnet-4.6 46,3%, GPT-5.4-Mini 40,4%, Grok-4.3 68,7%
- SOB Value Acc: Interfaze 79,5% vs Gemini-3-Flash 77,3%, Claude-Sonnet-4.6 77,9%, GPT-5.4-Mini 75,1%, Grok-4.3 78,4%
O Interfaze também supera fornecedores especializados de OCR como Chandra OCR e Reducto, de acordo com a fonte.
Preços
O Interfaze tem o preço de $1,50 por milhão de tokens de entrada e $3,50 por milhão de tokens de saída — alinhado com o Gemini-3-Flash.
Para Quem Serve
Desenvolvedores que constroem pipelines de alto volume de OCR, extração de documentos, pesquisa web, transcrição de áudio/diarização de locutores, tradução ou detecção de objetos/GUI que precisam de precisão determinística sem o custo de LLMs completos.
📖 Leia a fonte original: HN AI Agents
👀 See Also

Plugin de Memória do Agente OpenClaw: Contexto Persistente Entre Sessões
Um desenvolvedor criou um plugin de memória para o OpenClaw que injeta contexto relevante de conversas passadas antes de cada turno e armazena novos fatos e eventos após cada turno, resolvendo o problema de agentes esquecerem tudo entre sessões.

Suporte do MCP Integrado ao llama.cpp com Novos Recursos de Interface Web
O pull request do Model Context Protocol (MCP) para o llama.cpp foi mesclado, adicionando suporte ao MCP, chamadas de ferramentas, um loop agentivo e um seletor de servidor ao lado do llama-server/WebUI.

Prime Agent: Um Arnês de Codificação RLM Auto-melhorável com REPL Persistente e CRUD de Agentes
Prime Agent é um harness de codificação open-source construído sobre um kernel IPython persistente e um Modelo de Linguagem Recursivo, permitindo que agentes gerenciem seu próprio contexto e subagentes.

Assistência de Configuração do OpenClaw Oferecida pela ClawSet
A ClawSet oferece serviços de configuração para o OpenClaw, com foco em entender as necessidades do cliente. O serviço inclui uma chamada de configuração por US$ 99 e um mês de suporte para solução de problemas.