아남 카라-3: 인터랙티브 AI 아바타의 발전

아남은 인터랙티브 아바타를 생성하도록 설계된 최신 모델 카라-3을 출시했습니다. 이 아바타는 확산 트랜스포머가 오디오를 모션 임베딩(머리 위치, 시선, 입 모양, 표정 포함)으로 변환하는 2단계 파이프라인을 활용합니다. 이러한 임베딩은 참조 이미지에 적용되어 비디오 프레임을 생성하며, 재학습 없이 어떤 얼굴이든 애니메이션화할 수 있습니다.
특히, 카라-3은 H200에서 약 70ms의 첫 프레임 시간을 달성할 수 있어 단일 GPU에서 많은 동시 아바타 세션을 지원합니다. 이 속도는 부분적으로 오디오-모션 변환에 사용된 새로운 플로우 매칭 변형 덕분이며, 기존 기술은 불안정한 것으로 입증되었습니다.
독립적인 블라인드 평가에 따르면, 카라-3은 HeyGen, Tavus, D-ID와 같은 경쟁사보다 성능이 우수했으며, 다양한 지표에서 평균 24% 더 높은 점수를 기록했습니다. 스피어만 상관 계수 0.697로 입증된 반응성은 시각적 품질(0.473)보다 사용자 경험에 더 큰 영향을 미치는 것으로 나타났습니다.
아남은 또한 비용이 많이 드는 단계를 다시 거치지 않고 반복적 개발을 용이하게 하기 위해 훈련 데이터 파이프라인 백본인 메타크시를 오픈소스화했습니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

로컬 Qwen 3.6 대 프론티어 모델의 코딩 프리미티브 비교: 단일 파일 HTML 캔버스 구동 애니메이션
Reddit 사용자가 로컬 Qwen 3.6 양자화 모델과 프론티어 모델(Claude, Gemini, GPT, Kimi)을 밀집된 단일 파일 HTML 캔버스 주행 애니메이션 작업에서 비교했습니다. 로컬 Qwen 3.6-27B Q4_K_M은 일부 프론티어 모델 출력보다 더 자연스러운 움직임과 레이어링을 제공했습니다.

클로드의 100만 컨텍스트 윈도우 토큰 소모 분석: 데이터가 보여주는 무한 성장과 캐시 미스 증폭 현상
클로드의 100만 컨텍스트 윈도우 분석 결과, 토큰 소비가 급증하는 두 가지 복합적 요인이 밝혀졌습니다: 자동 압축 없이 무제한으로 증가하는 컨텍스트와 대규모 컨텍스트에서 발생하는 비용이 큰 캐시 미스입니다. 저자는 JSONL 세션 파일에서 개인 토큰 사용량을 분석하는 파이썬 스크립트를 제공합니다.

버디가 클로드 에이전트로 직원 70%를 대체하는 30만 달러 이상의 역할을 거절 — 레딧, 도덕적·기술적 현실을 논쟁하다
Reddit 게시물이 워크플로우 매핑, Claude/GPT 에이전트 파이프라인 구축, 그리고 직원의 70%를 해고하는 'AI 전환 책임자' 역할을 거부한 친구에 대해 설명합니다. 게시자는 30만 달러 이상의 조건이 시간을 낭비하고 C-레벨의 망상이 무너지는 것을 지켜보기에 충분히 값지다고 주장합니다.

Anthropic이 고정 확장 사고를 폐기하고 Claude 모델에 적응형 사고를 강제하다
Anthropic이 Opus 4.6 및 Sonnet 4.6에서 수동 확장 사고(고정 예산)를 지원 중단하고, Opus 4.7에서는 완전히 제거합니다(400 오류 반환). 적응형 사고가 기본적으로 강제되며, 커뮤니티는 이를 비용 절감 조치로 보고 반발하고 있습니다.