RTX 5060 Ti 16GB 로컬 LLM 벤치마크: 코딩용 30B 모델이 여전히 선두를 달리고 있습니다

✍️ OpenClawRadar📅 게시일: April 19, 2026🔗 Source
RTX 5060 Ti 16GB 로컬 LLM 벤치마크: 코딩용 30B 모델이 여전히 선두를 달리고 있습니다
Ad

RTX 5060 Ti 16GB 로컬 LLM 성능 결과

32GB DDR4 RAM을 탑재한 RTX 5060 Ti 16GB에서 llama-server b8373 (46dba9fce)을 사용하여 테스트한 결과, 로컬 LLM 코딩 워크플로우에 대한 실용적인 성능 특성을 확인할 수 있었습니다. 설정은 llama.cpp를 사용했으며, 특정 실행 옵션으로는 fa=on, ngl=auto, threads=8을 포함한 고속 경로와 KV 설정 -ctk q8_0 -ctv q8_0이 적용되었습니다.

모델 성능 결과

벤치마크는 여러 양자화된 모델을 비교하여 다음과 같은 주요 결과를 도출했습니다:

  • 최고의 기본 코딩 모델: Unsloth Qwen3-Coder-30B UD-Q3_K_XL
  • 최고의 고컨텍스트 코딩 옵션: 동일한 Unsloth 30B 모델을 96k 컨텍스트에서 사용
  • 최고의 고속 35B 코딩 옵션: Unsloth Qwen3.5-35B UD-Q2_K_XL

성능 지표

로컬 테스트에서 측정된 토큰 생성 속도:

  • Jackrong Qwen 3.5 4B Q5_K_M: 88 tok/s
  • LuffyTheFox Qwen 3.5 9B Q4_K_M: 64 tok/s
  • Jackrong Qwen 3.5 27B Q3_K_S: ~20 tok/s
  • Unsloth Qwen 3.0 30B UD-Q3_K_XL: 76.3 tok/s
  • Unsloth Qwen 3.5 35B UD-Q2_K_XL: 80.1 tok/s

크로스 플랫폼 비교

20개의 질문, 32k 컨텍스트, max_tokens=800으로 일치시킨 테스트 결과:

  • Unsloth Qwen3-Coder-30B UD-Q3_K_XL: Windows: 79.5 tok/s, 품질 7.94 | Ubuntu: 76.3 tok/s, 품질 8.14
  • Unsloth Qwen3.5-35B UD-Q2_K_XL: Windows: 72.3 tok/s, 품질 7.40 | Ubuntu: 80.1 tok/s, 품질 7.39
  • Jackrong Qwen3.5-27B Claude-Opus Distilled Q3_K_S: Windows: 19.9 tok/s, 품질 8.85 | Ubuntu: ~20.0 tok/s, 품질 8.21
Ad

설정 참고사항

30B 코더 경로는 jinja, reasoning-budget 0, reasoning-format none을 사용했습니다. 35B UD 경로는 c=262144, n-cpu-moe=8을 사용했습니다. 35B Q4_K_M 안정 튜닝의 경우 설정은 -ngl 26 -c 131072 --fit on --fit-ctx 131072 --fit-target 512M이었습니다.

특히, 35B Q4_K_M 모델은 이 카드에서 안정적으로 실행되기 위해 특정 튜닝이 필요했지만, 실제 사용에서는 이전 UD-Q2_K_XL 경로보다 성능이 뛰어나지 않았습니다. 저자는 더 작은 모델(9B 경로)과 더 무거운 실험(35B Q4_K_M)이 기대와 달리 실제 사용에서 가장 강력한 선택이 아니라는 점을 발견했습니다.

Ubuntu 성능 테스트

Jackrong 27B 모델에 대한 Ubuntu에서의 추가 집중 테스트 결과 최소한의 변동을 보였습니다:

  • -fa on, 자동 병렬 처리: 19.95 tok/s
  • -fa auto, 자동 병렬 처리: 19.56 tok/s
  • -fa on, --parallel 1: 19.26 tok/s

플래시 어텐션 설정과 병렬 처리 매개변수는 이 특정 모델의 성능에 미미한 영향을 미쳤습니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

Jan-Code-4B: 로컬 개발을 위한 경량화된 코드 튜닝 모델
Tools

Jan-Code-4B: 로컬 개발을 위한 경량화된 코드 튜닝 모델

Jan 팀은 Jan-v3-4B-base-instruct를 기반으로 한 4B 파라미터 코드 튜닝 모델인 Jan-Code-4B를 출시했습니다. 이 모델은 Claude Code의 Haiku를 대체할 수 있도록 설계되어 로컬에서 실행되면서도 향상된 코딩 지원을 제공합니다.

OpenClawRadar
무료 OpenClaw 비용 계산기는 실행 전 구성 비용을 보여줍니다.
Tools

무료 OpenClaw 비용 계산기는 실행 전 구성 비용을 보여줍니다.

한 개발자가 실행 전에 OpenClaw 구성 비용을 계산하는 무료 오픈소스 브라우저 도구를 만들었습니다. 이 도구는 기본 모델, 폴백 체인, 하트비트 소모, 청구 모드별로 비용을 세분화합니다.

OpenClawRadar
🦀
Tools

니들: FFN 전혀 없이 구축된 2600만 파라미터 도구 호출 모델

Needle은 MLP가 없는 26M 파라미터 함수 호출 모델로, 소비자 기기에서 6000 tok/s 프리필과 1200 tok/s 디코드를 달성합니다. 단일 호출 도구 호출에서 FunctionGemma-270M, Qwen-0.6B, Granite-350M, LFM2.5-350M을 능가합니다.

OpenClawRadar
클로드 코드 가이드라인 탐구: 65줄의 미니멀리스트 접근법
Tools

클로드 코드 가이드라인 탐구: 65줄의 미니멀리스트 접근법

클로드 코드 확장 프로그램은 '코딩 전에 생각하라'를 강조하며 단 65줄의 마크다운으로 핵심적인 AI 코딩 원칙을 담고 있습니다. 단순함에도 불구하고 개발자들 사이에서 주목할 만한 인기를 얻었습니다.

OpenClawRadar