PinchBenchがMac Studio M3 Ultra上でQwenとNemotronをランク付け:Nemotron Superがコーディングで99.2%を達成
PinchBenchはOpenClawのローカルモデルベンチマークツールです。ある開発者がMac Studio M3 Ultra(256GB RAM、60コアGPU)上で6つのモデルを実行した結果を公開しました。温度は0.8、コンテキストウィンドウは対応モデルでは200,000トークンに設定されています。以下のランキングはその投稿から直接引用したもので、日常使いのモデルを選ぶ前に気になる差も含まれています。
全結果
| # | モデル | ディスクサイズ | 最大トークンウィンドウ | 総合 / コーディング |
|---|---|---|---|---|
| 1 | Qwen3.6 35B A3B | 20.4 GB | 262k | 87.9% / 92.6% |
| 2 | QWEN3-Coder-next-Q8 | 84.8 GB | 262k | 85.5% / 97.9% |
| 3 | Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive | 78.7 GB | 262k | 83.5% / 91.7% |
| 4 | Nemotron-3-super | 86.1 GB | 1.05M | 78.2% / 99.2% |
| 5 | QWEN3.8-flash-next | 95.43 GB | 262k | 71.2% / 79.2% |
| 6 | Nemotron-3-nano-30b-a3b-mlx | 33.6 GB | 262k | 65.8% / 65.1% |
投稿にはDolphin-Mistral-24b-venice-edition-mlx-8b(25.1 GB、131kトークンウィンドウ)も記載されていますが、ソーステキストではベンチマークの合計が途中で切れています。書かれているままでは結果として使えません。
注目すべき点
- Qwen3.6 35B A3Bはバランスで勝る。総合スコア最高(87.9%)でコーディングも92.6%と強く、ディスク上はわずか20.4 GB。筆者の日常使いモデルでもあります。
- QWEN3-Coder-next-Q8はコーディング特化型。コーディング97.9%だが総合は85.5%と低め。ディスクは84.8 GBで35B A3Bの4倍以上。筆者はこのテスト以前は使ったことがなく、試してみると述べています。
- Nemotron-3-superはコーディングスコア99.2%で最高だが、総合78.2%はトップ4の中で最低。コンテキストウィンドウは1.05Mトークンで最長、Qwenモデルの4倍です。
- Nemotron SuperとNanoの差は大きい。コーディング99.2%対65.1%、総合78.2%対65.8%。Nanoはサイズが半分以下(33.6 GB対86.1 GB)で、その差の一部が説明できます。
- QWEN3.8-flash-nextはサイズの割に振るわず。95.43 GBとテスト中最大ながら、71.2% / 79.2%でQwen3.5-122B(78.7 GB)を下回りました。
筆者による2つの注意点
第一に、Mac上でQWEN3.8に有効な設定が見つかっておらず、機能する設定を求めています。QWEN3.8-flash-nextの低スコアは、それが解決するまではモデルの限界と解釈すべきではありません。
第二に、すべての数値はM3 Ultraハードウェア上、温度0.8での単一マシン・単一実行によるものです。このランキングは自身のPinchBench実行の出発点として扱い、判定とはしないでください。特に85〜95 GBのディスクをダウンロードに費やす前には。
誰向けか
Apple Silicon上でOpenClawや類似のエージェントを使い、30〜120Bモデルをロードできる十分なユニファイドメモリ(64GB以上)を持つ人向けです。32GB以下の場合、このリストで現実的な選択は20.4 GBのQwen3.6 35B A3Bのみですが、それはちょうど最高スコアのモデルでもあります。
📖 Read the full source: r/openclaw
👀 See Also

44,212件のClaude Codeログにおける「プロンプト千件あたりのFワード数」メトリクスで開発者のフラストレーションを追跡
ある開発者が「fpk」(プロンプト千件あたりのfワード数)を5ヶ月間、44,212件のClaude Codeプロンプトにわたって追跡したところ、フラストレーションがClaude Opus 4-5から4-7で3.4倍減少し、ほとんどの悪態はモデルではなく環境ツールに向けられていたことがわかった。

OpenClaw用のローカル音声テキスト変換にParakeet TDT 0.6b v3を使用
開発者がNVIDIAのParakeet TDT 0.6b v3モデルをONNX経由でCPU上でローカル実行できるように変換し、25のヨーロッパ言語をサポートしています。このモデルはDockerコンテナを通じてOpenAI互換のAPIエンドポイントを提供し、OpenClawでの音声ファイル文字起こしとの統合を可能にします。

OpenClawクライアント、ライブAPIコスト追跡、支出上限、詳細なエージェント制御を追加
OpenClaw Clientにライブ使用状況UIが搭載され、円形プログレスバー、エージェントごとの支出上限、サブエージェント管理、スキルの切り替え、異なるプロバイダからのモデル切り替えが可能になりました。

LivingAgents.ai: Claude APIを使用したWebベースのAIエージェントシミュレーション
LivingAgents.aiは、Claude APIによって駆動されるエージェントが採集、取引、製作、攻撃、繁殖、そして永久的な死といった行動を行うウェブベースのシミュレーションです。各行動には実際のLLM呼び出しが必要となります。