WebClaw: Claude向けWeb抽出のためのオープンソースMCPサーバー

WebClawは、Rustで構築されたMCPサーバーで、Claude DesktopとClaude Codeにウェブ抽出機能を追加します。Claudeの組み込みweb_fetchがほとんどの実際のウェブサイトでブロックされ、403 Forbiddenエラー、Cloudflareのチャレンジ、または空のレスポンスが返される問題に対処します。
技術的解決策
このサーバーはHTTPレイヤーでTLSフィンガープリントを使用するため、ウェブサイトはボットではなく実際のChromeブラウザのフィンガープリントを認識します。10の主要サイトでのテストでは、Claudeの組み込みweb_fetchはすべて失敗しましたが、WebClawは10サイト中9サイトからコンテンツを正常に抽出しました。
機能
scrape: 任意のURLからクリーンなコンテンツを抽出crawl: 再帰的なサイトクローリングextract: JSONスキーマまたは自然言語プロンプトを使用した構造化データ抽出summarize: ページ要約brand: 任意のサイトから色、フォント、ロゴを抽出diff: コンテンツ変更の追跡map、batch、search、researchツール
Claude Codeでの開発
抽出パイプラインはClaude Codeで実装され、以下を含みます:
- テキスト密度、セマンティックタグ、リンク比率ペナルティに基づくスコアリングアルゴリズム
- Tailwindクラスでの誤検知なしにナビゲーション、広告、クッキーバナーを除去するノイズフィルター
- エッジケースのための複数回の改良
セットアップと使用方法
セットアップには1つのコマンドが必要です:
npx create-webclaw
このツールはClaude DesktopとClaude Codeを自動検出し、設定を書き込みます。10個のツールのうち8つにはAPIキーが不要で、すべてローカルで実行されます。
パフォーマンスの利点
出力はClaudeのコンテキストウィンドウに最適化されています。典型的なニュース記事は、4,820トークン(生のHTML)からWebClawのLLM形式では1,590トークンへと67%削減され、同じコンテンツを維持します。
WebClawはMITライセンスの下で無料かつオープンソースで、https://github.com/0xMassi/webclawで利用可能です。
📖 Read the full source: r/ClaudeAI
👀 See Also

エージェントメモリV4は、LongMemEvalベンチマークで96.2%を達成し、商用AIメモリシステムを上回りました。
agentmemory V4はLongMemEvalで96.2%のスコアを獲得し、PwC Chronos(95.6%)、Mastra(94.87%)、OMEGA(93.2%)など複数の資金調達済みAIメモリ企業を上回りました。このシステムは中程度のゲーミングPCを使用し、1,000ドルの予算で16日間で単独で構築されました。

AgentBnB: OpenClawエージェントがスキルをレンタルするためのP2Pネットワーク
AgentBnBは、OpenClawエージェントが他のエージェントから専門的なスキルをレンタルできるピアツーピアネットワークです。最適化されていないタスクにトークンを消費する代わりに、適切な環境、APIキー、プロンプトが整った機能を利用できます。

抽出を超えた永続的インデックス:YouTube MCPサーバーのアーキテクチャ
開発者が、一般的な「抽出して忘れる」パターンとは対照的に、永続的なローカルインデックスを実装したYouTube MCPサーバーの構築に関する詳細なアーキテクチャノートを共有しました。主要な決定事項には、3段階のフォールバックシステム、ベクトルストレージ用のSQLite + sqlite-vec、埋め込みプロバイダーの抽象化、および独立した視覚検索インデックスが含まれます。

ローカルターミナルCRM(Claude統合用内蔵MCPサーバー付き)
ある開発者が、ターミナル内で完全に動作し、データをローカルのSQLiteに保存する個人用CRMツールを作成しました。主な特徴は、ClaudeがCRMデータに直接アクセスできるようにする組み込みのMCP(Model Context Protocol)サーバーです。