SPLICE 벤치마크 결과, 시각 언어 모델(VLMs)은 시간적 추론에 어려움을 겪고 언어 사전 지식에 의존하는 것으로 나타났습니다.

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
SPLICE 벤치마크 결과, 시각 언어 모델(VLMs)은 시간적 추론에 어려움을 겪고 언어 사전 지식에 의존하는 것으로 나타났습니다.
Ad

SPLICE 벤치마크 결과

SPLICE 벤치마크는 모델들이 섞인 비디오 클립의 올바른 순서를 재구성하도록 하여 시간적, 인과적, 공간적, 맥락적, 상식적 추론 능력을 테스트합니다. 이 연구는 원본 게시물 작성자가 공동 저자로 참여했으며, EMNLP 2025에서 발표되었습니다.

모델 성능 상세

테스트된 모델에는 Gemini Flash (1.5 및 2.0), Qwen2-VL (7B 및 72B), InternVL2.5, LLaVA-OneVision이 포함되었습니다. Gemini 2.0 Flash는 비전 전용 과제에서 51%의 점수를 기록했으며, 인간의 성능은 85%였습니다. 오픈소스 모델들은 특히 어려움을 겪었습니다:

  • LLaVA-OneVision-72B는 비전 전용 설정에서 무작위 추측 수준을 간신히 넘는 점수를 기록했습니다
  • InternVL2.5-78B도 비슷하게 낮은 성능을 보였습니다
  • Qwen2-VL-72B는 비전 전용에서 약 30%에 그쳤습니다
  • Qwen2-VL-7B는 72B 변형과 비슷한 성능을 보였는데, 이는 언어 모델을 확장하는 것이 비전 인코더의 병목 현상이 문제일 때 도움이 되지 않음을 시사합니다

언어 사전 지식 의존성

클립 내용을 설명하는 사람이 작성한 텍스트 주석이 추가되었을 때, 모델 성능은 크게 향상된 반면 인간 성능은 변함없이 유지되었습니다. 이는 모델들이 약한 시각적 이해를 보완하기 위해 언어 사전 지식에 의존함을 나타냅니다. 특히, Qwen2-VL-72B는 텍스트 전용 추론에서 Gemini를 능가했습니다.

Ad

시각적 지름길 행동

모델들은 문제가 있는 추론 패턴을 보였습니다. 첫 번째와 마지막 비디오 클립이 시각적으로 유사할 때(예: 프린터 문 열기와 닫기), 모델들은 그 클립들이 인접하다고 예측한 비율이 57%였으며, 이는 인간의 2.5%, 무작위 확률 27%와 비교됩니다. 이는 모델들이 사건에 대해 추론하기보다 시각적 유사성에 대한 패턴 매칭을 하고 있음을 시사합니다.

테스트 한계 및 향후 연구

이 연구는 Claude(비디오 입력을 지원하지 않음)나 OpenAI 모델들(테스트 당시 다중 비디오 입력을 안정적으로 처리할 수 없었음)을 테스트하지 않았습니다. 데이터셋은 공개되어 있으며, 게시물 작성자는 Gemini 3 Flash와 Qwen3-VL(기본 256K 인터리브 컨텍스트, 향상된 시공간 모델링, 최대 235B의 MoE 변형 포함)과 같은 최신 모델들이 SPLICE에서 테스트되어 언어 사전 지식 문제가 지속되는지 확인해야 한다고 언급했습니다. 예비 테스트는 언어 사전 지식 문제가 여전히 존재할 수 있음을 시사하지만, 모든 실험 샘플에 걸쳐 통계적 유의성이 확립되지는 않았습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

조사: 압축 변경으로 인해 클로드 코드 에이전트가 검증되지 않은 MEMORY.md 콘텐츠를 표면화함
News

조사: 압축 변경으로 인해 클로드 코드 에이전트가 검증되지 않은 MEMORY.md 콘텐츠를 표면화함

한 사용자가 Claude Code 에이전트가 작업 중간에 MEMORY.md의 내용을 재확인하지 않고 표시하고 있다고 보고했습니다. 이는 버전 2.1.139 및 2.1.141의 압축 변경 사항과 관련이 있습니다. 두 가지 복합 요인: '사용자 지침'의 과도한 보존과 자동 압축 임계값의 버그입니다.

OpenClawRadar
Anthropic의 플랫폼 전략과 OpenClaw의 대응
News

Anthropic의 플랫폼 전략과 OpenClaw의 대응

한 개발자가 Anthropic의 최근 외부 Claude 통합 제한을 플랫폼 회사의 전략적 조치로 분석하며, 제공자의 호의에 의존하기보다 이식 가능한 스택을 구축할 것을 주장합니다.

OpenClawRadar
SAP因AI成本飙升冻结大部分差旅和招聘——AI部门除外
News

SAP因AI成本飙升冻结大部分差旅和招聘——AI部门除外

404 미디어가 입수한 내부 이메일에 따르면, SAP는 AI 비용 급증으로 인해 대부분의 여행과 채용을 중단했으며, AI 관련 여행과 채용에만 예외를 두고 있습니다.

OpenClawRadar
신경과학에서 영감을 받은 AI 에이전트 메모리 아키텍처, Claude의 자동 꿈 기능으로 검증됨
News

신경과학에서 영감을 받은 AI 에이전트 메모리 아키텍처, Claude의 자동 꿈 기능으로 검증됨

개발자가 신경과학에서 영감을 받아 설계한 AI 에이전트용 메모리 아키텍처는 수면 주기 통합과 세 가지 특화 에이전트를 특징으로 하며, 최근 공개된 Claude의 Auto-dream 기능과 밀접하게 일치합니다. 이 기능은 메모리 파일에 대한 반성적 검토를 수행합니다.

OpenClawRadar