마이크로소프트, 훈련 인사이트와 함께 Phi-4-reasoning-vision-15B 멀티모달 모델 공개

모델 개요 및 이용 가능성
Phi-4-reasoning-vision-15B는 Microsoft Foundry, HuggingFace, GitHub를 통해 이용 가능한 150억 개 파라미터의 오픈 웨이트 멀티모달 추론 모델입니다. 추론 능력, 효율성, 훈련 데이터 요구사항을 균형 있게 조화시킨 컴팩트한 모델로 설계되었습니다.
능력 및 성능
이 모델은 이미지 캡션 작성, 이미지에 관한 질문하기, 문서 및 영수증 읽기, 숙제 도움, 이미지 시퀀스 변화 추론을 포함한 다양한 비전-언어 작업을 처리합니다. 특히 수학 및 과학 추론과 컴퓨터 및 모바일 화면 요소 이해 및 그라운딩에서 탁월한 성능을 보입니다.
성능 벤치마크는 10배 이상의 컴퓨팅 시간과 토큰이 필요한 더 느린 모델들과 비교해 경쟁력 있는 결과를 보여주며, 수학 및 과학 추론에서 유사하게 빠른 모델들보다 더 나은 정확도를 보입니다. 사용된 벤치마크에는 ChartQA_TEST, MathVista_MINI, MMMU_VAL, ScreenSpot_v2가 포함됩니다.
훈련 접근법 및 효율성
이 모델은 Phi-4(4000억 개 고유 토큰)를 기반으로 한 Phi-4-reasoning(160억 개 토큰으로 훈련됨)을 활용하여, 단 2000억 개의 멀티모달 데이터 토큰으로 훈련되었습니다. 이는 Qwen 2.5 VL, Qwen 3 VL, Kimi-VL, Gemma3와 같은 다른 멀티모달 모델 훈련에 사용된 1조 개 이상의 토큰과 비교됩니다.
마이크로소프트는 신중한 아키텍처 선택, 엄격한 데이터 큐레이션, 추론 및 비추론 데이터 혼합 사용을 이 모델 훈련의 핵심 교훈으로 강조합니다. 이 접근법은 정확도와 컴퓨팅 비용 간 트레이드오프의 파레토 프론티어를 확장하는 것을 목표로 합니다.
목표 사용 사례
이 모델은 더 작고 빠른 비전-언어 모델이 필요한 자원 제약 또는 상호작용 환경을 위해 고안되었습니다. 구조화된 추론 능력을 유지하면서도 적당한 하드웨어에서 실행할 수 있을 만큼 가볍습니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

클로드, 이제 어도비 크리에이티브 클라우드, 블렌더, 에이블톤 등에 연결
Anthropic이 Claude가 Adobe Creative Cloud, Affinity, Blender, Ableton, Splice, Autodesk와 통합될 수 있는 커넥터를 출시하여 자연어로 앱 제어 및 데이터 검색을 가능하게 했습니다.

클로드 오퍼스 4.6, CLAUDE.md 파일 참조 기능 추가
사용자들은 Claude Opus 4.6이 더 이상 CLAUDE.md에 참조된 파일을 자동으로 로드하지 않아 각 파일마다 수동으로 개입해야 한다고 보고합니다.

AI 에이전트 일관성 연구: 주요 결과와 실용적 시사점
Claude, GPT-4o, Llama 모델을 대상으로 한 3,000건의 실험 연구에 따르면, 일관된 에이전트는 80~92%의 정확도를 보인 반면, 일관되지 않은 에이전트는 25~60%로 떨어졌으며, 69%의 차이는 첫 번째 도구 호출 시 발생했습니다.

클로드 온보딩 경험에서 확인된 네 가지 UX/제품 격차
사용자가 데스크톱, Cowork, Dispatch 및 iPhone 앱에서 Claude를 설정하는 동안 실제 사용 중에 네 가지 특정 UX/제품 격차를 확인했습니다. 문제에는 데스크톱이 오프라인 상태일 때 Dispatch 작업이 무한 루프에 빠지는 것, Dispatch의 단일 지속적 스레드, Chrome의 탭 고정 채팅 패널, 모바일 앱 지식 베이스 UI에서 Google Drive 파일이 누락되는 것이 포함됩니다.