Qwen 3:0.6Bのファインチューニングによる質問分類 - ベースライン対ファインチューニング結果

Torgeir Helgevold氏が、Qwen 3:0.6Bをファインチューニングして家庭用質問を分類する実践的な手順を公開しました。目的は、RAG検索の前に質問をhvac、pool、cookingなどのカテゴリにマッピングし、ベクトル検索空間を狭めることです。
ベースライン結果 – ファインチューニングなしのプロンプト
未調整のQwen 3:0.6Bモデルに厳格なプロンプト(「リストからカテゴリ名のみを返せ」)を使ったところ、131件のテスト質問中13件のみ正解 – 正答率9.9%。よくある失敗は、electric/appliancesのような広すぎるラベルの多用、apartmentsのような新しいカテゴリの生成、nullの返却でした。
ファインチューニングの設定
- 使用モデル: Qwen 3:4B(一般QA用)、Qwen 3:0.6B(分類用)
- フレームワーク: Unsloth(オープンソース、QwenとLlamaに対応)
- データセット: 約850件のラベル付きデータ – 70/15/15分割(訓練/評価/テスト)
- データ例:
{ "question": "When did we replace our pool pump?", "category": "pool" }, { "question": "Who serviced the hot water heater for the home?", "category": "water heater" }
主要なポイント
600Mパラメータのモデルでも、十分な訓練データがあれば特定ドメインの信頼できる分類器にファインチューニングできる。この記事によると、ファインチューニング後の正答率は10%から80~90%以上に向上し、RAGシステムの前処理ステップとして小型モデルが適していることを示唆している。
📖 出典全文: HN LLM Tools
👀 See Also

Claude Code向けのスキル作成原則(159のオープンソーススキルから)
開発者が、159のスキルを持つオープンソースのスキルレジストリを構築・維持する中で得た、Claude Code向けの効果的なスキル作成のための10の原則を公開しました。これらの原則は、実際のエージェントの使用状況から観察された実用的な実装パターンに焦点を当てています。

Claudeコードチートシート(140のヒントとLLMs.txtファイル)
GitHubリポジトリには、難易度別にタグ付けされた14のセクションに整理された140のヒントを含むClaude Codeチートシートが含まれています。リポジトリには、Claudeに直接入力してヒントを学習または適用できるllms.txtファイルが含まれています。

OpenClaw Dockerユーザーの皆様: 破損したDiscordおよびチャンネル拡張機能を修正するには、コミット0c926a2c5に固定してください
Docker経由でOpenClawを更新後、Discord、Signal、WhatsAppなどのチャネル拡張機能がモジュールインポートエラーで動作しなくなりました。この問題はコミットd9c285e93と2つ目のDocker固有のバグに起因しています。安定した回避策としてコミット0c926a2c5に固定してください。

SOUL.mdルールは、長時間のAIエージェントセッションでドリフトする問題とその修正方法
SOUL.mdのルールは最初の10〜15メッセージでは完璧に機能しますが、会話のコンテキストが初期のシステムプロンプトを上書きするため、メッセージ20〜30あたりからずれ始めます。解決策は、個別のタスクごとにセッションをリセットするため、/newをより積極的に使用することです。