머큐리 2: 실시간 AI 코딩을 위한 확산 기반 모델

머큐리 2란 무엇인가
머큐리 2는 확산 기반 AI 모델로, 토큰을 순차적으로가 아닌 병렬로 생성하며, 여러 단계에 걸쳐 출력을 개선하는 과정을 사용합니다. 이 접근 방식은 토큰을 하나씩 디코딩하는 기존의 자기회귀 모델과 다릅니다.
기술 사양
- 생성 방식: 순차적인 토큰별 디코딩 대신 확산 기반 생성
- 처리 접근법: 토큰을 병렬로 생성하고 몇 단계에 걸쳐 개선
- 성능: NVIDIA Blackwell GPU에서 1,009 토큰/초 달성 주장
- 가격: 입력 토큰 100만 개당 $0.25, 출력 토큰 100만 개당 $0.75
- 컨텍스트 윈도우: 128K 토큰
- 추론 능력: 조정 가능한 추론
- 도구 통합: 스키마 정렬 JSON 출력과 함께 기본 도구 사용
- API 호환성: OpenAI API 호환
목표 사용 사례
개발자들은 머큐리 2를 다음과 같은 용도로 포지셔닝하고 있습니다:
- 코딩 어시스턴트
- 에이전트 루프(다단계 추론 체인)
- 실시간 음성 시스템
- 다중 홉 검색이 있는 RAG/검색 파이프라인
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

AI 에이전트는 Cala MCP 서버 테스트에서 자연어보다 구조화된 쿼리를 선호합니다
Cala 팀은 자연어 질의, 구조화된 질의 언어, 직접적인 개체/관계 탐색이라는 세 가지 지식 그래프 접근 방법을 갖춘 MCP 서버를 구축했습니다. 에이전트들은 몇 분 안에 자연어를 포기하고, 아무런 프롬프트 없이 구조화된 질의와 그래프 탐색을 선택했습니다.

NYC 병원, 팔란티어 계약 종료… 영국 진출은 검토 중
뉴욕시 공립 병원 시스템이 팔란티어와의 400만 달러 계약을 10월에 갱신하지 않고 자체 시스템으로 전환할 예정입니다. 한편 팔란티어는 3억 3천만 파운드 규모의 NHS 계약과 새로운 영국 금융 규제 기관 계약으로 인해 프라이버시 논란에 직면하고 있습니다.

반AI 감정과 언캐니 밸리 효과 분석
최근 설문조사에 따르면 대중의 AI에 대한 회의론이 커지고 있으며, 2026년 3월 기준 미국인의 55%가 일상생활에서 AI가 이익보다 해를 더 많이 끼칠 것이라고 믿고 있습니다. 이 글은 AI가 어떻게 부조화된 사회적 기대를 통해 불쾌한 골짜기 반응을 유발하는지 탐구합니다.

Gemma 4 대 Qwen 3.5 블라인드 평가 결과 (Claude Opus 심사위원)
30개 질문에 대한 블라인드 평가에서 Claude Opus 4.6을 심사위원으로 사용해 Gemma 4 31B, Gemma 4 26B-A4B, Qwen 3.5 27B를 비교했습니다. Qwen 3.5 27B는 46.7%의 대결에서 승리했지만, 세 번의 0점 응답으로 인해 평균 점수는 더 낮았습니다.