마이크로소프트, 훈련 인사이트와 함께 Phi-4-reasoning-vision-15B 멀티모달 모델 공개

모델 개요 및 이용 가능성
Phi-4-reasoning-vision-15B는 Microsoft Foundry, HuggingFace, GitHub를 통해 이용 가능한 150억 개 파라미터의 오픈 웨이트 멀티모달 추론 모델입니다. 추론 능력, 효율성, 훈련 데이터 요구사항을 균형 있게 조화시킨 컴팩트한 모델로 설계되었습니다.
능력 및 성능
이 모델은 이미지 캡션 작성, 이미지에 관한 질문하기, 문서 및 영수증 읽기, 숙제 도움, 이미지 시퀀스 변화 추론을 포함한 다양한 비전-언어 작업을 처리합니다. 특히 수학 및 과학 추론과 컴퓨터 및 모바일 화면 요소 이해 및 그라운딩에서 탁월한 성능을 보입니다.
성능 벤치마크는 10배 이상의 컴퓨팅 시간과 토큰이 필요한 더 느린 모델들과 비교해 경쟁력 있는 결과를 보여주며, 수학 및 과학 추론에서 유사하게 빠른 모델들보다 더 나은 정확도를 보입니다. 사용된 벤치마크에는 ChartQA_TEST, MathVista_MINI, MMMU_VAL, ScreenSpot_v2가 포함됩니다.
훈련 접근법 및 효율성
이 모델은 Phi-4(4000억 개 고유 토큰)를 기반으로 한 Phi-4-reasoning(160억 개 토큰으로 훈련됨)을 활용하여, 단 2000억 개의 멀티모달 데이터 토큰으로 훈련되었습니다. 이는 Qwen 2.5 VL, Qwen 3 VL, Kimi-VL, Gemma3와 같은 다른 멀티모달 모델 훈련에 사용된 1조 개 이상의 토큰과 비교됩니다.
마이크로소프트는 신중한 아키텍처 선택, 엄격한 데이터 큐레이션, 추론 및 비추론 데이터 혼합 사용을 이 모델 훈련의 핵심 교훈으로 강조합니다. 이 접근법은 정확도와 컴퓨팅 비용 간 트레이드오프의 파레토 프론티어를 확장하는 것을 목표로 합니다.
목표 사용 사례
이 모델은 더 작고 빠른 비전-언어 모델이 필요한 자원 제약 또는 상호작용 환경을 위해 고안되었습니다. 구조화된 추론 능력을 유지하면서도 적당한 하드웨어에서 실행할 수 있을 만큼 가볍습니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

유튜브 AI 비디오 자동 레이블링: 2026년 간소화된 레이블 및 자동 감지
YouTube, AI 라벨 업데이트: 더 눈에 띄는 배치, 사실적인 AI 콘텐츠 자동 감지, YouTube 자체 AI 도구나 C2PA 메타데이터로 제작된 동영상에는 영구 라벨 적용.

Firefox 148은 AI 킬 스위치와 향상된 개인정보 보호 기능을 추가합니다.
Firefox 148은 사용자가 챗봇 프롬프트와 AI 생성 링크 요약을 포함한 모든 AI 기능을 비활성화할 수 있는 'AI 킬 스위치' 기능을 도입했습니다. 이 업데이트는 원격 업데이트와 데이터 수집에 대한 더 많은 제어권도 제공합니다.

마이크로소프트, 클로드 코드 라이선스 취소 — AI 에이전트 확장 비용 너무 높아
마이크로소프트가 대부분의 Claude Code 라이선스를 취소하고 엔지니어들을 GitHub Copilot CLI로 전환합니다. 우버는 2026년 AI 예산을 4개월 만에 소진했습니다. 토큰당 비용은 오히려 증가할 수 있습니다.

OpenClaw Docker 사용자분들께: 2026.3.13 업데이트에 누락된 Docker 태그
OpenClaw 버전 2026.3.13이 출시되었지만, Docker 사용자는 업데이트를 피해야 합니다. Docker 이미지에 'latest'와 '2026.3.13' 태그가 모두 없기 때문입니다. npm이나 git에서 실행하는 사용자는 영향을 받지 않습니다.