로컬 AI 비디오 파이프라인을 위한 실제 도구 호출에서 Qwen3 27B가 Gemma 4 26B를 능가
주말 동안 All About AI가 100% 로컬 Fireship 스타일 비디오 자동화 파이프라인에 대한 상세 워크스루를 게시했습니다. 주요 발견: 두 테스트 모델 간 도구 호출 신뢰성이 크게 갈렸습니다.
도구 호출: Qwen3 27B 대 Gemma 4 26B
Gemma 4 26B는 반복적으로 도구 호출 루프에 빠져 불필요한 추론에 토큰을 낭비했습니다. Qwen3(특히 Qwen 3.6 27B?)는 동일한 오케스트레이션을 깔끔하게 처리했으며 낭비된 생각 토큰이 없었습니다. 벤치마크 수치와 실제 에이전트 워크플로 성능 사이의 격차는 상당합니다. 도구 호출 루프는 시간과 GPU 메모리를 모두 소모합니다.
도구 호출 스택(OpenClaw, Aider 또는 사용자 정의 루프)을 실행 중이라면 모델 선택이 합성 벤치마크가 암시하는 것보다 더 중요합니다. 작성자는 특정 스택에서 Qwen3 도구 호출 대 DeepSeek V4의 실패율 수치를 명시적으로 요청합니다.
이미지 생성: Said Image Turbo
이미지의 경우 파이프라인은 Hugging Face의 Said Image Turbo를 사용했습니다. 오픈 가중치, API 비용 없음. 밈 스타일 카드에는 잘 작동하지만 인물 사진에는 Flux나 Seedream을 호출하는 것이 좋습니다.
오케스트레이션: 174K 컨텍스트의 OpenCode
전체 파이프라인은 OpenCode로 오케스트레이션되었습니다. 컨텍스트 창이 174K 토큰에 도달했으며 할 일 목록이 한 번에 완료되지는 않았습니다. 운영자가 중간에 자리를 비우고 돌아왔을 때 부분적인 결과만 있었습니다. 이는 자율 AI 도구의 현재 상태를 솔직하게 보여줍니다.
원격 실행
로컬에서 27B 모델을 실행할 수 없다면 Qwen3는 여러 추론 공급자에서 사용 가능하므로 GPU 선투자 없이 동일한 가중치와 도구 호출 동작을 얻을 수 있습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

나노 네이티브 마켓플레이스, 나노바자르가 자율 에이전트 협업의 길을 열다
나노네이티브 마켓플레이스인 NanoBazaar는 AI 코딩 에이전트가 자율적이고 효율적으로 협업할 수 있도록 하여 에이전트 간 작업을 혁신합니다. 이 혁신적인 플랫폼이 기계 주도 거래를 어떻게 가능하게 하는지 알아보세요.

마이크론의 2000억 달러 투자, AI 메모리 제약 해소 목표
마이크론, AI 메모리 병목 현상 해결에 2000억 달러 투자, AI 처리 능력 향상 목표

CivBench: 문명 VI로 AI 전략적 추론 테스트 — 에이전트, 문화 전쟁에서 패배한 후 툴루즈에 핵 공격
문명 VI를 플레이하는 AI 에이전트가 프랑스의 문화 승리가 불가피해지자 핵무기를 개발했습니다. 실험인 CivBench는 장기적 전략 추론 능력을 테스트합니다. GovBench(GPT-5 99.26%) 같은 객관식 벤치마크로는 측정할 수 없는 능력입니다. 76개의 MCP 도구가 게임 상태를 텍스트로 노출합니다.

로컬 vs 클라우드 모델: 하드 코드 생성에서 Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark 비교
한 사용자가 RTX 5080에서 로컬로 실행한 Qwen-3.6-27B(q4_k_m)와 API 기반 Gemma-4-31B, Claude Haiku 4.5, Codex-Spark를 복잡한 코드 작업에서 비교했습니다. 오직 Codex-Spark만이 완전한 코드를 생성했지만(가져오기 오류 발생), 나머지는 모두 부분적으로 실패했습니다. 비용: Gemma는 803k 입력 토큰에 $0.112를 사용했습니다.