ATLAS: 적응형 테스트 타임 학습 프레임워크, 500달러 GPU로 코딩 벤치마크에서 Claude Sonnet을 능가

ATLAS의 기능
ATLAS(Adaptive Test-time Learning and Autonomous Specialization)는 고정된 소형 모델을 지능형 인프라로 감싸 최첨단 API 모델과 경쟁할 수 있는 프레임워크입니다. 미세 조정, API 호출 또는 클라우드 의존성 없이 구조화된 생성, 에너지 기반 검증, 자가 검증 수리를 사용합니다. 이 시스템은 완전히 자체 호스팅되며 데이터가 기기를 떠나지 않습니다.
벤치마크 결과
하드웨어: RTX 5060 Ti 16GB | 모델: Qwen3-14B-Q4_K_M (고정)
- LiveCodeBench v5: 599개 작업에서 74.6% pass@1-v(k=3)
- GPQA Diamond: 198개 k=5 다중 선택 지식 추론 작업에서 47.0%
- SciCode: 341개 k=1 교차 도메인 과학 코딩 작업에서 14.7%
참고: pass@k-v(k=3)는 작업당 하나의 솔루션을 제출하며, 3개의 후보 중 최상의 선택 + Lens 선택 + 실패 시 반복 수리를 통해 생성됨을 의미합니다. 단일 샷 생성이 아닙니다.
V3 파이프라인 제거 분석
- 기준선 (V3 없음): 54.9%
- +Phase 1 (PlanSearch + BudgetForcing + DivSampling): 67.3% (+12.4pp)
- +Phase 1+2 (Lens 라우팅): 67.3% (+0.0pp)
- +Phase 1+3 (자가 검증 개선): 74.6% (+7.3pp)
Phase 3는 내부 검증을 위해 자가 생성 테스트 케이스를 사용합니다 — 모델은 수리 중 정답 키를 절대 보지 않습니다. PR-CoT는 42개 작업 중 36개를 구제합니다 (Phase 3 구제의 85.7%).
비용 및 성능 비교
- DeepSeek V3.2 Reasoning: 86.2% LCB pass@1, ~$0.002/작업 (API, 단일 샷)
- GPT-5 (high): 84.6%, ~$0.043/작업 (API, 단일 샷)
- ATLAS V3 (pass@1-v(k=3)): 74.6%, ~$0.004/작업 (지역 전기만, 3개 중 최상 + 수리 파이프라인)
- Claude 4.5 Sonnet: 71.4%, ~$0.066/작업 (API, 단일 샷)
- Claude 4 Sonnet: 65.5%, ~$0.066/작업 (API, 단일 샷)
ATLAS 비용 계산: 전기 요금 $0.12/kWh 기준 (~165W GPU, 599개 작업에 ~1시간 55분). ATLAS는 지연 시간을 비용과 교환합니다 — 파이프라인은 단일 API 호출보다 작업당 더 오래 걸립니다.
작동 방식
V3 파이프라인은 세 단계로 구성됩니다:
- Phase 1: 생성 — 제약 조건 추출과 다양한 계획을 포함한 PlanSearch, 사고 토큰 제어를 통한 Budget Forcing
- 검증 — 에너지 점수 매기기(5120차원 자가 임베딩)와 샌드박스 코드 실행을 포함한 Geometric Lens
- Phase 3: 수리 — 모델 생성 I/O 쌍을 사용한 Self-Test Generation과 다중 관점 사고의 연쇄를 통한 PR-CoT Repair
워크플로: PlanSearch → Budget Forcing → k=3 후보 → Geometric Lens → 에너지 정렬 → Sandbox → 모두 실패 시 → Self-Test Generation → PR-CoT Repair → 수리된 코드 → Sandbox.
단일 패치된 llama-server가 K3s에서 실행되며, 추측 실행을 통한 생성과 임베딩 서비스를 모두 제공합니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

AgentCall: 클로드 코드가 구글 미트, 줌, 팀즈 통화에 팀원으로 참여하도록 하기
AgentCall.dev가 귀하의 기존 Claude Code, Codex 또는 Cursor 세션을 Google Meet, Teams 또는 Zoom에 연결하여 음성, 화면 공유 및 채팅을 지원합니다 — 데스크톱 캡처 없이, 다이렉트 모드에서는 제3자 데이터 없음.

2026년을 위한 4가지 관리형 OpenClaw 호스팅 제공업체 비교
한 개발자가 2개월 동안 4개의 관리형 OpenClaw 호스팅 제공업체를 테스트하여 설정 시간, 가동 시간, 통합 안정성, 모델 라우팅, 비용, 다단계 작업 처리 능력을 기준으로 순위를 매겼습니다. LobsterTank은 기본 컨테이너 호스팅으로 월 2달러, KiwiClaw는 더 나은 지원으로 월 39달러, xCloud는 견고한 가동 시간으로 월 24달러, RunLobster은 광범위한 도구 통합과 정액제 가격으로 월 49달러입니다.

AVP 프로토콜은 토큰 효율성을 위해 텍스트 대신 KV-캐시를 공유할 수 있도록 LLM 에이전트를 지원합니다
AVP(에이전트 벡터 프로토콜)는 LLM 에이전트들이 텍스트 대신 KV 캐시를 직접 전달할 수 있게 하여 토큰 처리량을 73-78% 줄이고, Qwen, Llama, DeepSeek 모델에서 2-4배의 속도 향상을 달성합니다. 이 프로토콜은 HuggingFace와 vLLM 커넥터와 호환되며 Python 패키지로 제공됩니다.

클로드 코드 루틴: AI 개발 워크플로우를 위한 자동화된 클라우드 작업
Claude Code 루틴은 개발자가 Claude Code 구성을 Anthropic이 관리하는 클라우드 인프라에서 실행되는 자동화된 작업으로 저장할 수 있게 합니다. 루틴은 저장소에 대한 프롬프트의 무인 실행을 위해 예약, API, GitHub 트리거를 지원합니다.