日本語訳: 新モデルアーキテクチャ「Interfaze」、決定論的タスクでGemini-3-FlashとGPT-5.4-Miniを凌駕

Interfazeは、Interfaze社が開発した新しいモデルアーキテクチャで、タスク固有のDNN/CNNモデルとオムニトランスフォーマーを統合し、高精度な決定論的タスクを大規模に処理することを目的としています。100万トークンのコンテキストウィンドウ、最大32,000トークンの出力を備え、テキスト、画像、音声、ファイル入力に対応し、オプションで推論機能も提供します。
ベンチマーク結果
同社のベンチマークによると、Interfazeは同価格帯のモデル(Gemini-3-Flash、GPT-5.4-Mini、Claude Sonnet 4.6、Grok-4.3などのFlash/ミニモデル)との9つの直接比較テストにおいてリードしています:
- OCRBench V2:Interfaze 70.7% vs Gemini-3-Flash 55.8%、Claude-Sonnet-4.6 54.7%、GPT-5.4-Mini 52.7%、Grok-4.3 54.7%
- olmOCR:Interfaze 85.7% vs Gemini-3-Flash 75.3%、Claude-Sonnet-4.6 73.9%、GPT-5.4-Mini 80.1%、Grok-4.3 81.9%
- RefCOCO:Interfaze 82.1% vs Gemini-3-Flash 75.2%、Claude-Sonnet-4.6 75.5%、GPT-5.4-Mini 67.0%、Grok-4.3 25.0%
- VoxPopuli(WER、低いほど良い):Interfaze 2.4% vs Gemini-3-Flash 4.0%
- Spider 2.0-Lite:Interfaze 52.9% vs Gemini-3-Flash 45.2%、Claude-Sonnet-4.6 49.6%、GPT-5.4-Mini 26.7%、Grok-4.3 45.9%
- GPQA Diamond:Interfaze 89.9% vs Gemini-3-Flash 88.5%、Claude-Sonnet-4.6 89.9%、GPT-5.4-Mini 82.8%、Grok-4.3 73.6%
- MMMLU:Interfaze 90.9% vs Gemini-3-Flash 88.7%、Claude-Sonnet-4.6 84.9%、GPT-5.4-Mini 75.3%、Grok-4.3 89.7%
- MMMU-Pro:Interfaze 71.1% vs Gemini-3-Flash 67.6%、Claude-Sonnet-4.6 46.3%、GPT-5.4-Mini 40.4%、Grok-4.3 68.7%
- SOB Value Acc:Interfaze 79.5% vs Gemini-3-Flash 77.3%、Claude-Sonnet-4.6 77.9%、GPT-5.4-Mini 75.1%、Grok-4.3 78.4%
また、情報源によると、InterfazeはChandra OCRやReductoといった専門のOCRプロバイダーも上回っています。
料金
Interfazeの料金は、入力トークン100万あたり1.50ドル、出力トークン100万あたり3.50ドルで、Gemini-3-Flashと同程度です。
対象ユーザー
大量のOCR、ドキュメント抽出、ウェブ検索、音声文字起こし/話者識別、翻訳、またはオブジェクト/GUI検出パイプラインを構築する開発者で、完全なLLMのコストをかけずに決定論的な精度を必要とする方に適しています。
📖 全文はこちら: Source
👀 See Also

Claude Code v2.1.90は、CLAUDE_CODE_NO_FLICKERフラグによるマウスサポートを追加しました。
Anthropicは、チャットインターフェース内でマウスサポートを可能にする新機能を備えたClaude Code v2.1.90をリリースしました。ユーザーは、claudeを実行する前に環境変数CLAUDE_CODE_NO_FLICKER=1を設定することで有効化できます。

OpenClaw Memory-Core用外部リランカープラグイン:古いGPUを再利用する
開発者がOpenClaw用のプラグインを公開。メモリーコアが外部リランカーを使えるようになり、CPU負荷の高いQMDを回避して古いGPUを活用。Qwen3モデルで動作。

UIUCのAIティーチングアシスタントが11モデルを並行してサブ2秒の応答を実現
UIUCのAI TAチャットボットは、テキスト/画像の検索、生成、モデレーション、ランキングのために11のモデルを並列実行し、中央値2秒の応答時間を達成。Pinecone RAGとRLHFデータセットを備えたオープンソース。

Relvyは、OpenRCAベンチマークにおいてClaudeの根本原因分析精度を12パーセントポイント向上させます。
Relvyは、ランブックを自動化するツールで、OpenRCAベンチマークにおける根本原因分析のClaudeの精度を12パーセントポイント向上させたことを実証しました。この結果は、11ポイントを獲得したHacker Newsの投稿で共有されました。