Gemma 4 31B가 FoodTruck Bench에서 더 큰 모델들을 능가합니다

✍️ OpenClawRadar📅 게시일: April 21, 2026🔗 Source
Gemma 4 31B가 FoodTruck Bench에서 더 큰 모델들을 능가합니다
Ad

벤치마크 결과 및 분석

Gemma 4 31B는 FoodTruck Bench 벤치마크에서 3위를 달성하며, 여러 더 크고 확립된 모델들을 능가했습니다. Reddit 토론에 따르면, 이 모델은 GLM 5, Qwen 3.5 397B 및 모든 Claude Sonnet 변형 모델들을 이겼습니다.

FoodTruck Bench는 복잡한 다단계 계획 작업에 대한 언어 모델을 테스트하는 벤치마크입니다. 원본 게시자는 Gemma 4의 성능이 벤치마크를 완료하지 못한 이전 모델들보다 장기적 작업을 더 잘 처리한다는 것을 시사한다고 추측합니다. 특히, 이 모델은 작업 순서에서 후속 단계를 계획할 때 자체 조언을 효과적으로 듣는 것으로 보입니다.

이 결과는 Gemma 4 31B가 능가한 일부 모델들보다 상당히 작기 때문에 주목할 만합니다. 예를 들어, Qwen 3.5 397B는 Gemma 4 31B보다 약 12.8배 더 많은 매개변수를 가지고 있습니다. 이 성능은 특정 유형의 추론 작업에 대해 모델 아키텍처와 훈련 접근 방식이 매개변수 수만큼 중요할 수 있음을 시사합니다.

FoodTruck Bench는 확장된 행동 시퀀스에 걸쳐 컨텍스트를 유지해야 하는 실용적인 계획 시나리오에서 모델을 테스트합니다. 이 벤치마크의 설계는 실제 애플리케이션에서 다단계 작업을 실행해야 하는 AI 에이전트와 작업하는 개발자들에게 특히 관련이 있습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
News

Claude Code v2.1.234: GitLab MR 배지, 자동 계속, 보안 강화

Claude Code v2.1.234는 GitLab MR 배지 추가, 사용량 제한 후 자동 재개, Windows NT 네임스페이스 경로 차단을 통한 NTLM 자격 증명 누출 방지 기능을 제공합니다.

OpenClawRadar
IPO 앞두고 AI 일자리 종말 예측 거둬들이는 알트만과 아모데이
News

IPO 앞두고 AI 일자리 종말 예측 거둬들이는 알트만과 아모데이

오픈AI의 샘 알트먼과 앤트로픽의 다리오 아모데이가 AI가 사무직 일자리를 없앨 것이라는 경고를 철회하고 있습니다. 두 회사는 각각 1조 달러 규모의 IPO를 준비 중입니다. 골드만삭스 CEO 데이비드 솔로몬은 자신이 처음부터 옳았다고 말합니다.

OpenClawRadar
Mac Studio에서 DeepSeek v4 Flash: 로컬 LLM이 컴파일러 코드의 실제 버그를 발견하다
News

Mac Studio에서 DeepSeek v4 Flash: 로컬 LLM이 컴파일러 코드의 실제 버그를 발견하다

한 개발자가 128GB Mac Studio에서 실행되는 DeepSeek v4 Flash가 컴파일러 코드베이스에서 유효한 버그를 성공적으로 식별했다고 공유했습니다. 이는 5개월 전만 해도 로컬 LLM으로는 불가능했던 작업입니다.

OpenClawRadar
클로드 오퍼스 4.8의 간헐적 자동 모드 오류: 상태 페이지 업데이트 없음
News

클로드 오퍼스 4.8의 간헐적 자동 모드 오류: 상태 페이지 업데이트 없음

사용자들이 claude-opus-4-8 모델의 자동 모드에서 간헐적 오류를 보고하고 있습니다. Bash 작업의 안전성을 판단하는 분류기가 일시적으로 사용 불가능하다는 오류 메시지가 나타나지만, 읽기 전용 작업(파일 읽기, 코드 검색)은 정상 작동합니다.

OpenClawRadar