Codiff v0.1.0: LLM生成コードレビュー用のローカル差分ビューア

Codiff v0.1.0は、LLMが書いたコードを頻繁にレビューする開発者向けのネイティブデスクトップ差分ビューアです。コミット前にステージング済みおよび未ステージングのGit変更を高速かつミニマルなインターフェースでレビューできます。
主な機能
- LLMウォークスルーモード:
codiff -wを実行すると、LLMが生成した差分のウォークスルーを取得できます。 - インラインコメント: 変更行にコメントを追加し、差分コンテキスト付きのMarkdownとしてレビュー全体をコピーできます。
- ファイルフィルターと検索: ファイルでフィルタリングし、差分内を検索できます。
- 大規模差分のパフォーマンス: 大量の差分を高速に処理できるように設計されています。
インストール
macOSアプリはGitHubリリースページからダウンロードしてください。インストール後、Codiff > Install Terminal Helperを使用してcodiffコマンドを有効にします。
このツールは、diffs.comとtrees.softwareをLLMに指示して16分で構築され、オープンソースライセンスで利用可能です。
📖 完全なソースを読む: HN LLM Tools
👀 See Also

ベンチマーク結果:Mac Mini M4 16GBでテストされた331個のGGUFモデル
Mac Mini M4(16GB RAM)で331のGGUFモデルをベンチマークした結果、パレート最適モデルはわずか11モデルで、すべてがMixture-of-Expertsアーキテクチャでした。Mixture-of-Expertsモデルは性能を支配し、中央値で20.0トークン/秒を達成(密モデルは4.4トークン/秒)。

ライバルレビュー:AIエージェント計画のためのクロスモデルレビューループ
Rival-reviewはMITライセンスのツールで、プライマリAIコーディングエージェントの計画を実行前に第2のAIモデルで監査し、欠陥のあるロールバック計画、セキュリティホール、古い状態に基づく決定などの問題を検出します。

ベンチマークによると、AIブラウザ自動化ツールは、同一の精度にもかかわらず、トークンコストが2.6倍も異なることが示されています。
Claude Sonnet 4.6を使用した4つのCLIブラウザ自動化ツールのベンチマークを、6つの実世界タスクで実施した結果、すべてのツールが100%の精度を達成しましたが、openbrowser-aiは36,010トークンを使用したのに対し、他のツールは77,123〜94,130トークンを使用しました。ツール呼び出し回数がトークンコストの最も強力な予測因子でした。

Agent-Desktop: OSアクセシビリティツリーによる構造化デスクトップ自動化
Agent-desktopは、OSのアクセシビリティAPIを通じてネイティブアプリを検査・操作するための53のコマンドを持つクロスプラットフォームCLI(Rustバイナリ、約15MB)で、JSON出力を提供します。スクリーンショットやビジョンモデルは不要です。段階的なスケルトントラバーサルにより、SlackやVS Codeのような高密度アプリではトークン使用量を78〜96%削減します。