GPU 시세 · VRAM · 온디바이스 AI

En septiembre de 2026, la subida de la memoria volvió a agrandar el tramo de 8GB. Primero los precios: coste por GB con la mediana de anuncios reales de Danawa —La 3060 12GB arrasa en el primer puesto en el rango de 45.000 KRW, y los tres modelos nuevos de 8GB van a 75,000~100,₩000/GB. Si ya tienes una tarjeta de 8GB, con la tabla de abajo apuras.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Tarjeta (mediana de venta real en Danawa) Precio de hoy por GB
RTX 3060 12GB 540.300 KRW 45,025 wones
RTX 5050 8GB 605.200 wons 75,650 KRW
RTX 5060 8GB 757,000 wones ₩94,625
RTX 5060 Ti 8GB 801,200 KRW ₩100,150

Builds que caben de verdad en 8GB

Modelo Compilación Pesos Notas
Llama-3.1-8B Q4_K_M 4.9 GB Estándar de facto del sector — línea de 6GB con KV incluido
DeepSeek-R1-Distill-8B Q4_K_M 4.9 GB Especializado en inferencia
Qwen3.5-9B Q4_K_M 6.8 GB La línea roja de los 9B: contexto a 8K
Qwen3.5-9B IQ2_M 4.9 GB Con prisa: empieza la degradación de calidad
Phi-4 Q3_K_M 7.2 GB 14B a la fuerza — si no encaja, IQ2
Llama-3.1-8B IQ4_XS 4.4 GB Ahorra 0,5GB frente a Q4

3 trampas

  • Contexto por defecto: si deja el deslizador de Ollama en 256K, un modelo de 2GB se hincha a 18GB y derrama a la CPU: ralentización medida de 3.4x (techfuelhq). Compruebe el reparto CPU/GPU con ollama ps.
  • Descarga automática a GPU: el modo ‘auto’ de LM Studio deja parte del MoE en la CPU sin avisar — subiendo la descarga al máximo recuperas un 23~31% (techfuelhq, medido en la 5080).
  • No reduzcas KV: solo activar una caché KV q8_0 ahorra 0.7GB en un 8B — compensa más que usar IQ2.

El cálculo de la banda de 12GB está enGuía de VRAM por uso, en portátilesGuía TGP.

Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos