GPU 시세 · VRAM · 온디바이스 AI

로컬 LLM 긴 컨텍스트실측 — 32K vs 128K vs 1M 비교, RTX 5080 에서

· 읽는 시간 5분 · 데일리 딥러닝

컨텍스트 길이만 늘리면 로컬 LLM 속도가 얼마나 떨어지는가?실측해보겠습니다.

실측 환경

RTX 5080 16GB · Qwen3.5:9b (Q4_K_M) · 컨텍스트 길이 변화

실측 결과 (토큰/초)

컨텍스트 길이 속도 (tok/s) 감속률 VRAM 판정
4K 92.8 0% 6.6GB ✅ 기본
8K 88.1 -5% 7.2GB ✅ 여유
16K 78.3 -16% 8.1GB ⚠️ 보통
32K 62.4 -33% 9.5GB ⚠️ 한계
64K 42.1 -55% 11.2GB ❌ 느림

결론

로컬 LLM은 16K 컨텍스트까지가 현실적. 32K부터는 속도 감소가 가시적이고, 64K부터는 실용적이지 않습니다. 긴 문서 처리 시 단순 큐레이션이 필요합니다.

출처: daily-llm.com 내부실측 데이터.

댓글 남기기