오케스트레이터: 프로세스보다 의도가 중요해야 하는 이유

현재 에이전트 스택은 뒤집혀 있습니다. 표면(터미널, 편집기)이 모델, 도구, 기록을 소유하고, 정체성은 일시적입니다. 새 터미널을 열면 에이전트가 사라집니다. 저자는 의도를 단일 프로세스에서 분리하는 오케스트레이터 계층을 제안합니다. 주요 속성:
- 세션 위의 정체성: 논리적 에이전트가 프로세스 전반에 걸쳐 지속됩니다. 세션은 오고 가지만 에이전트는 유지됩니다.
- 표면 간 라우팅: 에이전트가 작업을 다른 머신(예: 리포지토리 박스, GPU 박스, 휴대폰)에 분배하며, 이를 서로 관련 없는 것으로 취급하지 않습니다.
- 진정한 핸드오프 프리미티브: 수행된 작업, 미완료 작업, 차단된 결정 등을 담은 타입화된 객체로, 손실이 많은 채팅 기록이 아닙니다.
- 하위 에이전트가 아닌 동료 에이전트: 서로 다른 컨텍스트의 두 에이전트가 어느 쪽도 소유하지 않은 제어 평면을 통해 조정합니다.
- 크로스 드라이버 호출: "저렴한 모델이 요약하고, 비싼 모델이 실행"하는 것은 프롬프트 엔지니어링이 아닌 프리미티브입니다. 오케스트레이터는 비용, 지연 시간, 기능에 따라 단계별 런타임을 선택합니다.
- 지속되는 승인 표면: 에이전트가 승인을 위해 일시 중지되고 당신이 세 시간대 떨어져 있어도, 승인 요청이 당신에게 전달되며 에이전트를 계속 활성화할 필요가 없습니다.
구체적 예: 불안정한 테스트 분류
오늘날 세 개의 터미널을 열고 Claude, Gemini, Grok 사이에 스택 트레이스를 붙여넣습니다. 저자가 원하는 흐름은 하나의 오케스트레이터 의도 아래: "이 플레이크를 분류하고, 수정안을 제안하며, 리뷰를 받는다."
- Ollama (로컬): 테스트 로그를 분석하고, 노이즈를 제거하며, 구조화된 실패 요약을 생성합니다. 무료이며, 머신을 떠나지 않습니다.
- Gemini CLI: 요약과 리포지토리를 가져와 의심스러운 변경 사항을 식별하고 패치 초안을 작성합니다. 큰 컨텍스트, 코드 읽기에 강하며, 읽기 전용 리포지토리 접근 권한을 가집니다.
- Grok Build: 패치와 원본 실패를 받아 평결(배송/수정/에스컬레이션)을 렌더링합니다. 다른 모델 제품군이 두 번째 의견을 제공합니다. 쓰기 권한은 없습니다.
세 개의 런타임, 세 개의 권한 범위, 세 개의 비용 계층, 하나의 의도. 오케스트레이터는 단계 간에 핸드오프 객체를 전달하고 세 개의 분리된 대화 대신 하나의 승인을 표시합니다. Grok이 "에스컬레이션"이라고 말하면, 의도는 일시 중지되고 인간의 결정을 기다리며, Ollama나 Gemini를 계속 활성화할 필요가 없습니다.
지난 주 기준으로, 적어도 세 개의 터미널 네이티브 코딩 에이전트가 로컬에서 실행됩니다: Ollama 런타임, Google의 Gemini CLI, xAI의 Grok Build(계획 모드 및 병렬 하위 에이전트 포함). 모델은 저렴하고 교체 가능한 부분입니다. 오케스트레이터는 지루하고 내구성 있는 부분이어야 합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

코덱스 대화: AI 자동화에서 오픈클로의 후계자
코덱스가 이제 자기 자신과 소통할 수 있게 되어 AI 기반 자동화의 새로운 시대를 열었으며, 이전의 선두주자였던 오픈클로를 효과적으로 대체했습니다.

클로드 온보딩 경험에서 확인된 네 가지 UX/제품 격차
사용자가 데스크톱, Cowork, Dispatch 및 iPhone 앱에서 Claude를 설정하는 동안 실제 사용 중에 네 가지 특정 UX/제품 격차를 확인했습니다. 문제에는 데스크톱이 오프라인 상태일 때 Dispatch 작업이 무한 루프에 빠지는 것, Dispatch의 단일 지속적 스레드, Chrome의 탭 고정 채팅 패널, 모바일 앱 지식 베이스 UI에서 Google Drive 파일이 누락되는 것이 포함됩니다.

SenseNova-U1-8B-MoT: NEO-Unify 아키텍처를 갖춘 오픈 소스 네이티브 멀티모달 모델
센스노바가 센스노바-U1-8B-MoT를 출시했습니다. 이 모델은 시각 인코더와 VAE를 모두 제거하고 NEO-Unify 아키텍처를 사용하여 통합된 이해, 추론 및 생성을 가능하게 하는 네이티브 멀티모달 모델입니다. 텍스트-인포그래픽, 이미지 편집 및 인터리브 텍스트-이미지 생성에 탁월합니다.

Qwen 3 8B는 어려운 과제에 대한 블라인드 동료 평가에서 더 큰 모델들을 능가합니다.
10개의 소규모 언어 모델을 대상으로 13개의 어려운 첨단 과제에 대한 블라인드 동료 평가에서, Qwen 3 8B는 6개 평가에서 1위를 차지했으며 13개 과제 중 12개에서 상위 3위 안에 들었습니다. 이는 파라미터 수가 최대 4배 많은 모델들을 능가하는 성과입니다. 평가 범위에는 분산 락 디버깅, Go 동시성 버그, SQL 최적화, 베이지안 의료 진단, 심슨의 역설, 애로우의 투표 정리, 생존자 편향 분석이 포함되었습니다.