Kimi K2.6 대 Claude Opus 4.7: Minetest 현상금 게시판 모드 실제 테스트

두 모델을 이상한 코딩 작업(Minetest/Luanti 현상금 보드 게임 모드를 TypeScript 백엔드로 구축한 후 Composio를 통해 Google Sheets 로깅으로 확장)에서 비교한 흥미로운 실제 사례입니다. 두 모델 모두 동일한 프롬프트를 받았습니다. 자세한 내용은 원본 게시물에서 확인하세요.
설정
- Claude Opus 4.7: Claude Code 사용
- Kimi K2.6: OpenRouter의 OpenCode 사용
- 작업: 플레이어가 월드에 접속하여
/bounty를 실행하고, 작업을 받아 완료한 후 보상을 받고, 백엔드가 완료를 기록합니다. 두 번째 테스트: Composio를 통해 Google Sheets에 완료 기록을 로깅합니다.
가격
- Opus 4.7: 입력 $5/M, 출력 $25/M
- Kimi K2.6: 입력 $0.95/M, 출력 $4/M (캐시된 입력 $0.16/M)
테스트 1: 로컬 현상금 보드
Opus 4.7: 깔끔한 MVP. Express/Zod/Vitest 백엔드, Lua 모드, /bounty 흐름, 보상, 리더보드, 테스트 통과. 통계:
- 비용: ~$3.59
- 시간: API 12분, 실제 23분
- 코드: +1,688 / -0
- 출력 토큰: 54.8k
- 캐시 읽기: 2.8M
Kimi K2.6: 로컬 보드도 작동했지만 더 지저분했습니다. Opus의 1,688줄에 비해 4,671줄의 코드를 작성했습니다(+4,671 / -0). 비용: ~$0.39. 시간: ~9분 27초. 짜증난 부분은 Minetest 설정입니다. 전역 설정에 secure.http_mods = bountykimi를 썼지만, 다른 모드 이름으로 월드 레벨 설정을 만들어 실행 중인 모드에 HTTP API가 활성화되지 않았습니다. 테스터가 디버깅하는 데 30분 이상 걸렸습니다.
테스트 2: Composio + Google Sheets
Opus 4.7: Google Sheets 동기화가 작동했습니다. tsx watch와 환경 변수 로딩에 대한 몇 차례 시행착오 끝에 백엔드가 현상금을 완료하고 Sheets에 추가할 수 있었습니다. 통계:
- 비용: $16.03
- 시간: API 28분, 실제 1시간 17분
- 코드: +1,848 / -507
- 캐시 읽기: 22.3M
- 출력: 123.3k 토큰
Kimi K2.6: 실패했습니다. 개발 서버 문제, 테스트, 빌드 문제에 막혔습니다. Composio 통합을 작동 상태로 만들지 못했습니다. 약 25분과 135k+ 토큰 후 테스터가 중단했습니다. 비용: ~$5.03.
결론
- 최고의 로컬 MVP: Opus, 하지만 Kimi가 훨씬 더 가성비가 좋음
- 최고의 실제 통합: Opus가 월등히 앞섬
- 더 깔끔한 코드: Opus
- 더 저렴한 실험 모델: Kimi
테스트 결과 Kimi K2.6은 저렴한 로컬 코딩 작업에 흥미롭습니다. $0.39로 작동하는 Lua+TypeScript 모드를 얻는 것은 나쁘지 않습니다. 하지만 외부 도구, 설정 문제 및 실제 통합 작업이 포함되자 Opus 4.7이 확실히 앞섰습니다.
커밋, 스크린샷, 데모, 비용이 포함된 전체 분석은 원본 링크에서 확인하세요.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

AIME 2026 결과: 오픈 및 클로즈드 모델 모두 90% 이상 점수 획득
AI 모델이 AIME 2026에서 놀라운 90% 이상의 점수를 달성했으며, DeepSeek V3.2가 전체 테스트를 단 bash.09에 실행합니다.

中国AI工程师成为硅谷新势力
로스 알토스의 공유 주택에 잠입한 기자가 실리콘 밸리의 중국인 AI 연구자 커뮤니티를 탐구하며, 2억 달러 규모의 보상 패키지, 강한 근로 윤리, 네트워킹이 이루어지는 하우스 파티에 대해 설명합니다.

에이전트 실행 기록을 위한 개방형 표준: 공유 로그 스키마의 필요성
모든 에이전트 런타임이 고유한 로그 형식을 사용하여 디버깅, 감사, 도구 이식성에 단편화가 발생합니다. 필드는 이미 핵심 스키마로 수렴되고 있습니다 — 표준화할 때입니다.

Granite 4.1: IBM의 8B 밀집 모델, 벤치마크에서 32B MoE와 동급 성능
IBM의 Granite 4.1 8B 밀집 모델은 향상된 학습 데이터 품질 덕분에 ArenaHard, BFCL V3, GSM8K 등에서 이전 32B MoE 모델과 동등하거나 더 나은 성능을 보입니다.