ローカルでのLlama 3.2-1Bのシークレット検出用ファインチューニングがWizのモデルを上回る

ある開発者が、コード内のシークレット検出のためにLlama 3.2-1Bをローカルでファインチューニングすることに成功し、Wizの類似モデルの指標を上回ったことを文書化しました。このプロジェクトは、独自のAPIを一切使用せず、完全にローカルのAIツールで実施されました。
主な成果とアプローチ
開発者は、Wizの結果である86%の精度と82%の再現率を再現または上回ることを目指しました。数週末の作業の後、ファインチューニングされたLlama 3.2-1Bモデルで、88%の精度と84.4%の再現率を同時に達成しました。また、Qwen 3.5-2Bおよび4Bモデルもベンチマークし、これらは1Bモデルを上回る性能を示しましたが、その代償としてVRAM使用量と推論時間が増加しました。
データセットとトレーニングプロセス
この作業は、公開されているデータのみに依存しましたが、それだけでは不十分だったため、手続き的生成を用いてデータセットを拡張・改善しました。すべてのラベリングは、Qwen3-Coder-Nextモデルを使用してローカルで行われました。重要なトレーニング目標の一つは、モデルに構造化されたJSONを出力させることでした。初期段階では、未トレーニングのモデル(LlamaおよびQwen)はスキーマ準拠性で0%のスコアでしたが、トレーニング後には98-100%に改善しました。
課題と学び
開発者は、このプロセス中にいくつかの問題に直面しました:
- トレーニングに有害な高エントロピークラスが含まれていたため、これを特定して削除しました。
- データセット内の「ネガティブ」サンプル4,500件に実際の実世界のパスワードが含まれていることが判明し、モデルがシークレットを無視するようにトレーニングされていたことが分かりました。これを修正することで、パスワードの再現率が向上しました。
開発者は、トレーニング統計、例、プロセスのステップバイステップの詳細を含む完全な技術文書を公開しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

行動監視と設定変更によるAIエージェントコストの30%削減
開発者は、70個のcronジョブが結果をメインのチャットセッションにダンプしていたことで、コンテキストの肥大化と繰り返しの圧縮が発生し、OpenClawボットのトークン使用量を30%削減しました。修正には、cronの出力をTelegramに直接リダイレクトし、冗長な検索や過大なファイル読み込みなどの非効率性を特定する監視スキルを構築することが含まれました。

ソロデベロッパーがClaude Codeで屋外プラットフォームを構築:AI支援プロダクト開発の教訓
6年の経験を持つソフトウェアエンジニアが、フルタイムで働きながら数ヶ月かけてClaude Codeを使用し、12以上のデータソースを統合したアウトドアルートプラットフォーム「PathQuest」を構築しました。彼はAI支援開発を管理する具体的なワークフローと教訓を共有しています。

OpenClawニュースアシスタント:スポーツ+テクノロジーの重複排除と幻覚修正に100ドル投資
ある開発者が約100ドルを費やし、OpenClawを使ってスポーツとテクノロジー/AIニュース向けの個人ニュースアシスタントを構築した。主な問題:ハルシネーション(噂を事実として扱う、誤ったストーリーを統合)、10以上のソース間での重複排除、新鮮さと過去記事の再利用、トークンコスト。厳格なプロンプト、キャッシュ、重複排除、ランキング、検証、差分ロジックで改善したが、コストが法外になった。

ノンコーディングAIエージェントをClaude Codeで構築する:3つの実践例
RedditユーザーがClaude Codeを使用してAIエージェントを作成する個人セットアップを共有し、3つの具体的な実装を詳細に説明しています:メール、ToDo、カレンダーから情報を取得する自動朝のブリーフィングエージェント、Substack記事をキャプチャするtmuxベースのパイプライン、会議の要約エージェントです。