PinchBenchがMac Studio M3 Ultra上でQwenとNemotronをランク付け:Nemotron Superがコーディングで99.2%を達成

✍️ OpenClawRadar📅 公開日: September 24, 2026🔗 Source
Ad

PinchBenchはOpenClawのローカルモデルベンチマークツールです。ある開発者がMac Studio M3 Ultra(256GB RAM、60コアGPU)上で6つのモデルを実行した結果を公開しました。温度は0.8、コンテキストウィンドウは対応モデルでは200,000トークンに設定されています。以下のランキングはその投稿から直接引用したもので、日常使いのモデルを選ぶ前に気になる差も含まれています。

全結果

#モデルディスクサイズ最大トークンウィンドウ総合 / コーディング
1Qwen3.6 35B A3B20.4 GB262k87.9% / 92.6%
2QWEN3-Coder-next-Q884.8 GB262k85.5% / 97.9%
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78.7 GB262k83.5% / 91.7%
4Nemotron-3-super86.1 GB1.05M78.2% / 99.2%
5QWEN3.8-flash-next95.43 GB262k71.2% / 79.2%
6Nemotron-3-nano-30b-a3b-mlx33.6 GB262k65.8% / 65.1%

投稿にはDolphin-Mistral-24b-venice-edition-mlx-8b(25.1 GB、131kトークンウィンドウ)も記載されていますが、ソーステキストではベンチマークの合計が途中で切れています。書かれているままでは結果として使えません。

Ad

注目すべき点

  • Qwen3.6 35B A3Bはバランスで勝る。総合スコア最高(87.9%)でコーディングも92.6%と強く、ディスク上はわずか20.4 GB。筆者の日常使いモデルでもあります。
  • QWEN3-Coder-next-Q8はコーディング特化型。コーディング97.9%だが総合は85.5%と低め。ディスクは84.8 GBで35B A3Bの4倍以上。筆者はこのテスト以前は使ったことがなく、試してみると述べています。
  • Nemotron-3-superはコーディングスコア99.2%で最高だが、総合78.2%はトップ4の中で最低。コンテキストウィンドウは1.05Mトークンで最長、Qwenモデルの4倍です。
  • Nemotron SuperとNanoの差は大きい。コーディング99.2%対65.1%、総合78.2%対65.8%。Nanoはサイズが半分以下(33.6 GB対86.1 GB)で、その差の一部が説明できます。
  • QWEN3.8-flash-nextはサイズの割に振るわず。95.43 GBとテスト中最大ながら、71.2% / 79.2%でQwen3.5-122B(78.7 GB)を下回りました。

筆者による2つの注意点

第一に、Mac上でQWEN3.8に有効な設定が見つかっておらず、機能する設定を求めています。QWEN3.8-flash-nextの低スコアは、それが解決するまではモデルの限界と解釈すべきではありません。

第二に、すべての数値はM3 Ultraハードウェア上、温度0.8での単一マシン・単一実行によるものです。このランキングは自身のPinchBench実行の出発点として扱い、判定とはしないでください。特に85〜95 GBのディスクをダウンロードに費やす前には。

誰向けか

Apple Silicon上でOpenClawや類似のエージェントを使い、30〜120Bモデルをロードできる十分なユニファイドメモリ(64GB以上)を持つ人向けです。32GB以下の場合、このリストで現実的な選択は20.4 GBのQwen3.6 35B A3Bのみですが、それはちょうど最高スコアのモデルでもあります。

📖 Read the full source: r/openclaw

Ad

👀 See Also

44,212件のClaude Codeログにおける「プロンプト千件あたりのFワード数」メトリクスで開発者のフラストレーションを追跡
Tools

44,212件のClaude Codeログにおける「プロンプト千件あたりのFワード数」メトリクスで開発者のフラストレーションを追跡

ある開発者が「fpk」(プロンプト千件あたりのfワード数)を5ヶ月間、44,212件のClaude Codeプロンプトにわたって追跡したところ、フラストレーションがClaude Opus 4-5から4-7で3.4倍減少し、ほとんどの悪態はモデルではなく環境ツールに向けられていたことがわかった。

OpenClawRadar
OpenClaw用のローカル音声テキスト変換にParakeet TDT 0.6b v3を使用
Tools

OpenClaw用のローカル音声テキスト変換にParakeet TDT 0.6b v3を使用

開発者がNVIDIAのParakeet TDT 0.6b v3モデルをONNX経由でCPU上でローカル実行できるように変換し、25のヨーロッパ言語をサポートしています。このモデルはDockerコンテナを通じてOpenAI互換のAPIエンドポイントを提供し、OpenClawでの音声ファイル文字起こしとの統合を可能にします。

OpenClawRadar
OpenClawクライアント、ライブAPIコスト追跡、支出上限、詳細なエージェント制御を追加
Tools

OpenClawクライアント、ライブAPIコスト追跡、支出上限、詳細なエージェント制御を追加

OpenClaw Clientにライブ使用状況UIが搭載され、円形プログレスバー、エージェントごとの支出上限、サブエージェント管理、スキルの切り替え、異なるプロバイダからのモデル切り替えが可能になりました。

OpenClawRadar
LivingAgents.ai: Claude APIを使用したWebベースのAIエージェントシミュレーション
Tools

LivingAgents.ai: Claude APIを使用したWebベースのAIエージェントシミュレーション

LivingAgents.aiは、Claude APIによって駆動されるエージェントが採集、取引、製作、攻撃、繁殖、そして永久的な死といった行動を行うウェブベースのシミュレーションです。各行動には実際のLLM呼び出しが必要となります。

OpenClawRadar