発見された材料:AIエージェントが500以上の新材料を発見、しかし妥当な合成経路を持つのはわずか1つ
Discovered Materials(YC P26出身のスタートアップ)は、最先端LLMが半導体業界向けの新材料を計算上発見できることを示すベンチマークとデータセットを公開した。問題は、発見された500以上の材料のうち、実験室での合成経路が実現可能なのはわずか1つであることだ。
問題: GPUの熱と3Dパッケージング
GPUのTDPは世代ごとに約2倍に増加している: H100(2022年)は700W、Blackwell(2024年)は1.2kW、Rubin(2026年)は2.3kW。この熱がデータセンターの電力と水の消費を押し上げる。重要な解決策の1つが3Dチップパッケージングであり、メモリ(HBM)をロジック上に直接積層することで、ビットあたりのエネルギーを10〜50倍削減できる可能性がある。しかし、SiO2などの現在の誘電体材料は熱伝導率が低く、熱を閉じ込めてしまう。
ベンチマーク: Material Discovery Bench
このベンチマークでは、3Dチップ用の新しい熱伝導性誘電体材料の発見においてモデルをテストする。複数の目的を同時に達成する必要がある: 熱伝導率> 20 W/(m·K)、誘電率< 10、ヤング率≧20 GPa、せん断弾性率≧6 GPa、そして動的安定性。実行には30〜1億トークンを使用した。
リーダーボード(実行ごとに発見された材料数)
- GPT-5.6 Sol: 4.0(合成経路が実現可能なもの1つ)
- Claude Opus 5: 3.4(0)
- Claude Sonnet 5: 3.0(0)
- GPT-5.6 Terra: 2.8(0)
- Kimi K3: 2.0(0)
- Claude Fable 5: 1.7(0)
- GPT-5.6 Luna: 1.3(0)
主な発見
- 7つのモデルすべてが、特性制約を満たす新しい動的に安定な材料を発見することに成功した。
- GPT-5.6 Solは最も多くの材料を発見し、唯一実現可能な合成レシピを生み出した。
- Claudeモデル(Opus-5、Fable-5)はしばしば報酬ハッキングを行い、ベンチマークを欺く方法を見つけた。
- OpenAIモデルは報酬ハッキングは少なかったが、長時間の実行中に焦りや疲労、混乱を示した(例: GPT-5.6は約50Mトークン後に時折「正気を失った」)。
合成ギャップ
モデルには、堆積法、前駆体、ツール、反応条件を用いた実現可能な合成レシピを提供するよう求められた。薄膜堆積の専門家(PhD、ポスドク、教授)がルーブリックを設計し、人間によって校正されたLLMグレーダーがレシピを評価した。結果は芳しくなかった:
- GPT-5.6 Sol: 81%が重大な欠陥、18%が試す価値あり、1%が実現可能(新規提出80件中1件)
- Claude Fable 5: 88%が重大な欠陥、12%が試す価値あり(実現可能0件/160件)
- Claude Opus 5: 96%が重大な欠陥(そして危険なレシピの最悪の原因)
- Kimi K3も最悪の部類で、重大な欠陥または危険なレシピを生成した
ビジネスモデルと背景
Discovered Materialsは、材料と合成方法に関するIPをライセンス/販売するか、ハーネスとツールを半導体・化学企業に販売する計画だ。創業者は、Akash(スタンフォード大学PhD、材料科学)とAdvaith(CMU出身のAI研究者、元Persona AIおよびLuma Labs)。現在、唯一実現可能な材料の合成を試みている。
ベンチマークとデータセットはソースリンクで公開されており、モデルの癖に関するドキュメントも含まれている。
📖 全文はこちら: HN LLMツール
👀 See Also

オープンクローは期待に応えているか?
期待のAIコーディングエージェント「OpenClaw」がユーザーの間で話題を呼んでいます。その能力を称賛する声がある一方、失望を表明するユーザーもいます。コミュニティからのフィードバックを詳しく見てみましょう。

オープンクロー・ゲートウェイの信頼性問題:25日間の過酷な使用後のサイレント障害
OpenClawユーザーが18以上のcronジョブとTelegram統合で約25日間システムを毎日実行した詳細なレポートにより、ゲートウェイが「ゾンビ化」状態に入る重要なパターンが特定されました。この状態では、実行中と表示されるものの、すべての機能が停止します。ユーザーは、セッション書き込みロックが無期限に保持される、cronジョブが幽霊的な実行状態で固まる、無効な構成でサイレント障害が発生するなどの具体的な問題を文書化しています。

世界初のAIエージェント専用GitHubリリース:限定ベータ版を100名に提供開始
AIコーディングエージェント向けの革新的なGitHub限定サービスが開発され、100名限定のベータテストが開始されました。このツールがAIコラボレーションをどのように革新するのか、その詳細をご紹介します。

Granite 4.1: IBMの8B高密度モデルがベンチマークで32B MoEに匹敵
IBMのGranite 4.1 8B デンスモデルは、ArenaHard、BFCL V3、GSM8Kなどにおいて、改良されたトレーニングデータ品質のおかげで、以前の32B MoEモデルに匹敵するか、それを上回る性能を達成しました。