컨텍스트 길이만 늘리면 로컬 LLM 속도가 얼마나 떨어지는가?실측해보겠습니다.
실측 환경
RTX 5080 16GB · Qwen3.5:9b (Q4_K_M) · 컨텍스트 길이 변화
실측 결과 (토큰/초)
| 컨텍스트 길이 | 속도 (tok/s) | 감속률 | VRAM | 판정 |
|---|---|---|---|---|
| 4K | 92.8 | 0% | 6.6GB | ✅ 기본 |
| 8K | 88.1 | -5% | 7.2GB | ✅ 여유 |
| 16K | 78.3 | -16% | 8.1GB | ⚠️ 보통 |
| 32K | 62.4 | -33% | 9.5GB | ⚠️ 한계 |
| 64K | 42.1 | -55% | 11.2GB | ❌ 느림 |
결론
로컬 LLM은 16K 컨텍스트까지가 현실적. 32K부터는 속도 감소가 가시적이고, 64K부터는 실용적이지 않습니다. 긴 문서 처리 시 단순 큐레이션이 필요합니다.
출처: daily-llm.com 내부실측 데이터.
댓글 남기기