Lightning MLX: Apple Silicon向け高速ローカルAIエンジン、Qwen 35B-A3Bで220 tok/sを実現

Lightning MLXと呼ばれるApple Silicon向けの新しいオープンソース推論エンジンは、エージェントワークフロー(コーディングエージェント、ツール呼び出し、短いターンのタスク)に特化した最速のローカルAIエンジンであると主張しています。このプロジェクトはGitHubのsamuelfaj/lightning-mlxで入手できます。
ベンチマーク結果
作者は128GB RAMのMacBook Max M5でテストし、以下のトークン生成速度を報告しています:
- Qwen3.6-27B: 40.67 tok/s
- Qwen3.6-35B-A3B: 220.86 tok/s
これらの結果は、トークンごとにパラメータのサブセットのみを活性化するQwen3.6-35B-A3Bモデルで使用されている混合専門家アーキテクチャに対して、エンジンが特に効率的であることを示唆しています。
主な機能
- 短いターンのエージェント的ユースケース(コード生成、ツール呼び出し、高速推論ループ)に最適化
- MTPLX(カスタムサンプリングデフォルト)というプリセット構成を含む。作者は、これらのデフォルトが本番使用に適しているかどうかについてフィードバックを求めています。
- GitHub上でMITライセンス(推定)のオープンソース
フィードバック依頼
作成者はコミュニティに以下を積極的に求めています:
- ローカルコーディングエージェント向けのより良いベンチマーク設計
- MTPLXプリセットデフォルトに関する意見
- 他のApple Silicon構成(例:M1、M2、M3、M4、異なるRAMサイズ)でのテスト結果
対象ユーザー
エージェント的コーディングワークフローのためにApple Silicon上でローカルLLMを実行し、最大の推論速度を必要とする開発者。
📖 出典全文: r/LocalLLaMA
👀 See Also

OpenEvol:会話履歴を活用したLLMのためのオフライン自己改善パイプライン
OpenEvol v0.1.1は、手動でのラベル付けなしにファインチューニング用データセットを作成するために、AI会話履歴を自動的にマイニングするオフラインパイプラインです。初期段階ではCPUで動作し、OpenAI互換APIやHuggingFace Transformersを含む5つの教師バックエンドをサポートしています。

Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2モデルがLM Studio設定付きでリリースされました
Qwen3.5-9BアーキテクチャとClaude 4.6 Opusの学習データを統合した無検閲モデルが利用可能になりました。最適なパフォーマンスを得るためのLM Studio 0.4.7の設定(温度0.7、トップKサンプリング20など)が提供されています。

エージェントイメージスキル:Claudeコードエージェント向けシンプルな画像ホスティング
開発者が、Claude Codeエージェントが生成する画像(チャート、スクリーンショット、モックアップなど)を保存するためのシンプルな画像ホスティングサービスをhttps://images.labnocturne.comに構築しました。このサービスは、エージェントが画像を生成しても保存場所がないという問題を解決し、Cloudinaryの無料枠の制限、Imgur APIの信頼性の問題、基本的なURLホスティングにおけるS3の複雑さを回避します。

6GB GPUでのミーティング要約: qwen3.5:0.8Bは57秒で動作、Granite 4 350Mは幻覚を起こす
VoiceFlow v1.6.0 は、ローカルの会議録音と要約機能を追加しました。6GBのRTX 3060でサブ10億パラメータモデルをベンチマーク: qwen3.5:0.8Bは2.2GB VRAMで57秒かけて構造化された要約を生成し、Granite 4 350Mはひどく幻覚を起こします。