Claudeがリーマン予想のゼロ点の範囲を41.6%から67.2%に向上
Anthropicの未公開の研究版Claudeが、リーマンゼータ関数の零点のうち臨界線上にあるもの(リーマン予想ではすべての零点が臨界線上にあると予想されている)の割合に関する長年の下界を改善しました。その下界は41.6%から67.2%に跳ね上がり、研究者たちを驚かせました。AI自体はリーマン予想を証明したわけではありませんが、その結果は解析的整数論における顕著な進歩です。
突破口
Claudeの重要な洞察は、Baluyot、Goldston、Suriajaya、Turnage-Butterbaughによる結果(リーマン予想を仮定せずにMontgomeryの1973年の手法を適応した研究)と、Bombieriによる2000年の論文を組み合わせたことでした。簡単に言えば、ClaudeはWeilによって誘導される二次形式を持つ適切な関数空間を構築し、線上の零点と線外の零点に対応する正定値部分空間と負定値部分空間を考えました。一次および二次モーメント情報を用いて二次形式のランクに関する不等式を書き下すことで、新しい下界を達成しました。
Anthropicのノートによると、このアプローチは空間全体をまとめて扱い、二次形式が非対角であることを許容しており、これが先行研究からの結論を可能にしています。Anthropicの数学者2名が論文を検証し、非公式の専門家ノートを作成しました。また、外部の専門家であるBrian ConreyとDan Goldstonも短期間でレビューしました。
Claudeの作業方法
この結果は、Claude Codeを使用した2回のセッションで得られ、合計3100万出力トークンを使用しました。Anthropicのスタッフ(数学者ではない)であるJarred Sumnerが、Claudeに「真剣に挑戦して」とリーマン予想自体に取り組むよう促し、数学的な選択はモデルに任せました。最初に、Claudeは失敗した650のアイデアを生成し、別の実行を促しました。2回目のセッションでは、Claudeは1日半かけて約60のサブエージェントを調整し、2,400のシェルコマンドを実行し、数百のPythonスクリプトを作成しました。サブエージェントは、既知のゼータ零点に対して何千もの数値チェックを実行し、お互いの作業を査読しました。
形式的に検証可能な証明
注目すべきことに、Claudeはその結果の形式的に検証可能な証明も作成し、専門家向けの非公式ノートを補完しました。これは発見の妥当性を高めますが、チームはこれらの手法がリーマン予想自体を解決するとは期待していません。
AIエージェントを使用する開発者にとって、これは数学的推論がどこまで進んだか、そして数学者でない人がどのようにエージェントを導いて真の研究貢献を達成できるかを示す具体的な例です。
📖 出典全文を読む: HN AI Agents
👀 See Also

OpenAI、重要モデルの減速の数週間前に準備チームを解散
OpenAIは7月末に準備チームを解散したが、その数週間後、モデルが重要なサイバー閾値に達した。壊滅的リスクを評価していたチームはもはや存在しない。

NYC病院がPalantir契約を終了、英国での拡大に監視の目
ニューヨーク市の公立病院システムは、10月にパランティアとの400万ドルの契約を更新せず、自社システムへの移行を進める。一方、パランティアは、NHSとの3億3000万ポンドの契約や英国の金融規制当局との新契約をめぐり、プライバシー懸念に直面している。

AlphaEvolve:DeepMindのGemini搭載エージェントがゲノミクス、電力網、TPC回路にわたるアルゴリズムを最適化する
Google DeepMindが開発したGemini搭載のコーディングエージェント「AlphaEvolve」により、DeepConsensusのバリアント検出エラーが30%改善、AC Optimal Power FlowのGNN実行可能性が14%から88%に向上、量子回路エラーが10分の1に削減されました。

Qwen3.5-122B on Blackwell SM120: fp8 KVキャッシュの破損問題と性能調査結果
8x RTX PRO 6000 BlackwellハードウェアでのQwen3.5-122Bのテストでは、fp8_e4m3 KVキャッシュがエラーなしに壊れた出力を静かに生成することが判明し、代わりにbf16 KVキャッシュが必要でした。MTP最適化により単一リクエストの速度が2.75倍向上しましたが、DeltaNetの制約により他の最適化はブロックされました。