클로드, 리만 가설 영점 경계를 41.6%에서 67.2%로 향상
Anthropic의 공개되지 않은 연구용 버전의 Claude가 리만 제타 함수의 영점 중 임계선(리만 가설이 모든 영점이 존재한다고 예측하는 선) 위에 있는 영점의 비율에 대한 오랜 하한을 개선했습니다. 그 비율은 41.6%에서 67.2%로 뛰어올랐으며, 이는 연구자들을 놀라게 했습니다. AI가 리만 가설 자체를 증명하지는 못했지만, 이 결과는 해석적 정수론에서 주목할 만한 진전입니다.
돌파구
Claude의 핵심 통찰은 Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh의 결과(Montgomery의 1973년 기법을 리만 가설을 가정하지 않고 적용한 연구)와 Bombieri의 2000년 논문을 결합한 것이었습니다. 간단히 말해, Claude는 Weil이 유도한 이차 형식을 가진 적절한 함수 공간을 구성하고, 선 위와 선 밖의 영점에 해당하는 양의 정부호 및 음의 정부호 부분공간을 고려했습니다. 1차 및 2차 모멘트 정보를 사용하여 이차 형식의 계수에 대한 부등식을 작성함으로써 새로운 하한을 달성했습니다.
Anthropic 노트에 따르면, 이 접근 방식은 전체 공간을 함께 다루며, 이차 형식이 비대각선일 수 있도록 허용합니다. 이는 이전 연구의 결론을 가능하게 하는 단계입니다. 두 명의 Anthropic 수학자가 논문을 검증하고 비공식 전문가 노트를 작성했으며, 외부 전문가인 Brian Conrey와 Dan Goldston도 짧은 시간 안에 검토했습니다.
Claude의 작업 방식
이 결과는 Claude Code에서 두 세션을 통해 얻어졌으며, 총 3,100만 개의 출력 토큰이 사용되었습니다. Anthropic 직원(비수학자)인 Jarred Sumner는 Claude에게 리만 가설 자체에 '진지하게 도전'하도록 프롬프트를 주었고, 수학적 선택은 모델에 맡겼습니다. 처음에 Claude는 실패한 650개의 아이디어를 생성했고, 이로 인해 두 번째 실행이 이루어졌습니다. 두 번째 세션에서 Claude는 하루 반 동안 약 60개의 하위 에이전트를 조정하여 2,400개의 셸 명령을 실행하고 수백 개의 Python 스크립트를 작성했습니다. 하위 에이전트는 알려진 제타 영점에 대해 수천 번의 수치 검사를 수행하고 서로의 작업을 동료 검토했습니다.
형식적으로 검증 가능한 증명
주목할 점은 Claude가 전문가를 위한 비공식 노트를 보완하는, 결과에 대한 형식적으로 검증 가능한 증명도 생성했다는 것입니다. 이는 발견의 타당성을 높여주지만, 팀은 이 기법이 리만 가설 자체를 깨뜨릴 것으로 기대하지는 않습니다.
AI 에이전트를 사용하는 개발자에게 이는 수학적 추론이 얼마나 발전했는지, 그리고 비수학자가 에이전트를 이끌어 진정한 연구 기여를 할 수 있는지에 대한 구체적인 예입니다.
📖 전체 원문 보기: HN AI Agents
👀 See Also

Claude Code v2.1.200: 주요 수정 사항 및 권한 모드 변경
Claude Code v2.1.200은 AskUserQuestion 대화 상자가 더 이상 자동으로 계속되지 않도록 변경하고, 기본 권한 모드를 수동으로 전환하며, 백그라운드 에이전트 충돌 및 명단 손상을 수정합니다.

마크 저커버그, CEO 지원용 AI 에이전트 개발 중
월스트리트저널 보고서에 따르면, 마크 저커버그가 CEO 업무를 돕기 위한 AI 에이전트를 구축 중이라고 합니다. 이 기사는 해커뉴스에 공유되어 37점을 받고 30개의 댓글이 달렸습니다.

Claude 코드 v2.1.197: Claude Sonnet 5 기본, 100만 토큰, 프로모션 가격
Claude Code v2.1.197은 기본 모델로 Claude Sonnet 5를 도입하며, 기본 100만 토큰 컨텍스트 창과 8월 31일까지 100만 토큰당 $2/$10의 프로모션 가격을 제공합니다.

지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교
함수 호출을 통한 백엔드 코드 생성을 위해 로컬 및 프론티어 LLM을 엄격하게 벤치마크한 결과와 채점 기준표. 주요 발견: qwen3.5-35b-a3b가 DB/API 설계에서 gpt-5.4와 동등한 성능을 보였고, 조밀한 Qwen 27B가 397B MoE를 능가했습니다. 비용 문제로 프론티어 모델은 제외되었습니다.