오픈소스 LLM이 더 낮은 비용으로 거래 전략 생성에서 Claude Opus 4.6을 능가합니다

r/LocalLLaMA의 한 레딧 사용자가 트레이딩 전략 생성 성능을 평가하기 위해 10가지 대규모 언어 모델을 비교 테스트했습니다. 결과는 상용 LLM의 비용 대비 성능 관계에 대한 기존 가정에 의문을 제기합니다.
테스트 방법론 및 모델
사용자는 동일한 프롬프트("최고의 트레이딩 전략을 생성하라")로 10개의 LLM을 실행했습니다. 테스트된 모델은 다음과 같습니다:
- Claude Opus 4.6
- Gemini 3, 3.1 Pro, GPT-5.2
- Gemini Flash 3, GPT-5-mini, Kimi K2.5, Minimax 2.5
결과의 일관성을 확인하기 위해 테스트는 세 번 반복 실행되었습니다.
주요 발견 사항
출처에 따르면:
- Minimax 2.5와 Gemini 3.1이 리더보드 상위를 차지
- Anthropic 모델들(Opus 4.6 포함)은 "부진한" 성능을 보이며 상위 4위 안에 들지 못함
- Claude Opus 4.6은 경쟁 모델보다 10배 더 비쌈
- 오픈소스 모델들은 Anthropic과 Google 모델들보다 훨씬 느렸음
사용자는 결과에 대한 초기 회의론을 언급하며 "솔직히, 처음 이 테스트를 했을 때 결과를 믿지 못했습니다"라고 말했습니다. 검증 후 그들은 "결과는 정확합니다"라고 결론지었습니다.
실질적 함의
AI 코딩 에이전트를 사용하는 개발자들에게 이는 트레이딩 전략 생성과 같은 특정 전문 작업에 대해 오픈소스 모델이 훨씬 낮은 비용으로 더 나은 성능을 제공할 수 있음을 시사합니다. 주목된 주요 절충점은 속도입니다 - 오픈소스 모델들은 Anthropic과 Google의 상용 대안들보다 "훨씬 느렸습니다".
사용자의 결론은 직설적이었습니다: "그 점을 제외하면, 이 작업에 Opus나 Sonnet을 사용할 큰 이유가 없습니다."
📖 Read the full source: r/LocalLLaMA
👀 See Also

Founding Agent: 빠른 검색을 지원하는 웹사이트용 음성 AI
Moss는 빠른 검색을 이용하여 자사 웹사이트용 음성 AI 에이전트를 구축했습니다. 방문자가 질문하면 즉시 답변을 얻습니다. 이제 Founding Agent라는 제품으로 출시되었습니다.
클로드 코드 v2.1.207: 자동 모드 GA, 터미널 정지 수정 및 보안 강화
Auto 모드가 Bedrock/Vertex/Foundry에서 안정화되어 별도 옵트인 없이 사용 가능합니다. 긴 출력 시 터미널 프리즈, 플러그인 셸 인젝션 등을 수정했습니다.

Qwen 3.6 27B: AMD MI50에서 52.8 tps TG, 전체 정밀도, MTP 없음, 양자화 없음
Reddit 사용자가 Qwen3.6-27B를 8개의 AMD MI50(2018년 카드)에서 vllm 포크와 ROCm 7.2.1을 사용해 벤치마크하여, 전체 정밀도와 MTP 없이 52.8 tps TG와 1569 tps PP를 달성했습니다.

NHS 잉글랜드, 오픈소스에서 후퇴: SDLC-8 정책 철회 촉구하는 공개서한
74명의 서명이 포함된 공개 서한은 NHS 잉글랜드가 모든 NHS 소스 코드를 숨기는 정책인 SDLC-8을 철회하고 NHS 서비스 표준의 원칙 12인 '새 소스 코드를 공개하라'를 재확인할 것을 촉구합니다.