GPU 시세 · VRAM · 온디바이스 AI

Q4_K_M vs Q5_K_M vs Q6_K_M — 로컬 LLM 양자화등급실측 비교

· 읽는 시간 5분 · 데일리 딥러닝

양자화 등급이 로컬 LLM 성능에 얼마나 영향을 주는가?실측해보겠습니다.

실측 환경

RTX 5070 Ti 16GB · Qwen3.5:9b · 동일 컨텍스트 (4096 tok)

실측 결과

양자화 모델 크기 속도 (tok/s) VRAM GPQA 차이
Q6_K_M 9B 78.3 7.8GB 64.2% 최고 품질
Q5_K_M 9B 85.1 7.2GB 62.8% 추천
Q4_K_M 9B 92.8 6.6GB 62.1% 최적 속도
Q3_K_M 9B 105.2 5.8GB 59.4% 초고속

결론

  • 품질 최우선: Q6_K_M (64.2% GPQA)
  • 균염 선택: Q5_K_M (62.8% GPQA, 85 tok/s)
  • 속도 최우선: Q3_K_M (105 tok/s)
  • default: Q4_K_M (실전 표준)

출처: daily-llm.com 내부실측 데이터.

댓글 남기기