GPU 시세 · VRAM · 온디바이스 AI

Leí tres artículos y volví a escribirlo tras picar en mi propia calculadora. Los hechos y cifras vienen de los originales y de datos de mercado; las fórmulas y conclusiones, de este artículo. Señala en los comentarios cualquier cálculo erróneo.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Serverless frente a mi 4090: las cuentas van un paso por delante del artículo

1. «Elasticidad y coste»: las dos caras de la IA serverless

El artículo lo plantea así: si la carga oscila, serverless; si es estable 24/7, equipo dedicado. Formalmente correcto. Pero si lo metes en la tabla de precios coreanos de 2026, la conclusión se mueve: en Joonggonara la RTX 4090 promedia ₩3.56M. Con la escasez de memoria subió el precio del nuevo y el usado le siguió: un mercado donde la ventaja del comprador se acabó.

Esta es la cuenta que hice: 3.56 millones de wones depreciados en 36 meses son 99,000 wones/mes. Electricidad: 0.35kW de media en inferencia, 24 horas, son 252kWh/mes; a la tarifa alta residencial de 250 wones, 63,000 wones/mes. Total: unos 160,000 wones/mes. En la misma tarjeta, un modelo cuantizado de 13B a 25 tokens por segundo da, siendo conservador, 65 millones de tokens/mes. Unos 2 wones por millón de tokens. Para clasificación simple de documentos y asistencia de código, sobra rendimiento.

De aquí sale la conclusión que el artículo no dice. Si pagas más de 200.000 KRW/mes por APIs de inferencia de pago por uso, para todo lo que un modelo de clase 13B pueda reemplazar, lo local ya es abrumadoramente más barato. Así que la verdadera razón para comprar serverless no es el coste sino el rendimiento de los modelos más recientes y cero operaciones. Hay que cambiar la pregunta: no el precio sino la proporción. ¿Qué porcentaje de tu carga de trabajo puede empujarse a un modelo pequeño? Cuando esa proporción supera 70, la factura es dinero que se fuga, no estrategia; los equipos por debajo de 30 hacen bien en quedarse en serverless. El punto de inflexión no es el tamaño del modelo sino la distribución de dificultad del trabajo.

Una variable que el artículo omite: en un ciclo donde HBM y DDR suben a la vez, la GPU dejó de ser consumible y pasó a activo con valor residual. A la tabla de depreciación de la propiedad se le ha añadido una línea de cobertura. También dejo la condición de refutación: si en un año la 4090 de segunda mano cae por debajo de ₩3.56M, esta lógica falla.

Nvidia y MediaTek: no es un movimiento para matar al rival, sino para agrandar el tablero

2. Nvidia se asegura el liderazgo en infraestructura de IA con una inversión de 3.500 millones de dólares en MediaTek

Nvidia compra 3.500 millones en bonos convertibles de MediaTek y MediaTek adopta NVLink Fusion. Cooperación en tres frentes: infraestructura rack-scale, SoC de PC y automoción. Los comentaristas hablan de lock-in; yo primero hago la cuenta de la apuesta.

En lugar de frenar la huida de los hiperescaladores hacia silicio propio para escapar de las GPU, Nvidia los ató a su propio interconectado. Los clientes siguen comprando NVLink y redes de rack mientras fabrican sus propios chips, y el chip que diseñará MediaTek llevará HBM igualmente. Es un acuerdo que tiende un puente que AMD no puede cruzar en la competencia de lógica, a la vez que agranda la tarta completa de la demanda de memoria. Desde la óptica de SK hynix, la tarta de memoria crece, así que no pierde nada; de hecho, el cierre de hoy subió más que el de Samsung.

La evidencia se confirma en el informe de cadena de suministro del próximo trimestre. Si los pedidos de aceleradores personalizados de MediaTek se confirman, la utilización de TSMC subirá, pero el número de dispositivos HBM no distingue de plataforma. Mi opinión: este acuerdo es noticia de volumen de memoria, no de lógica.

Escucha permanente en Apple Watch: no es una constante de batería, es un problema de constante de NPU

3. Escucha permanente sin grabación: Apple desvela la privacidad de su IA

La clave son dos frases. El procesador S11 trata la voz siempre activa sin usar la batería. No guarda el audio original, solo procesa texto. Pero el verdadero cuello de botella de este diseño no es la batería.

Si no se conserva el original, el rebobinado en vivo que revisa lo dicho hace 15 segundos es imposible en principio. «Guardar solo texto» significa cortar antes; lo que lo sostiene es una tubería de audio permanente de ultra bajo consumo: en el fondo, diseño de NPU y ancho de banda de SRAM. Cuando Apple haga que esto funcione en la muñeca, la pelea que queda a los rivales no es el reconocimiento de voz sino la inferencia por vatio.

El impacto para los desarrolladores es aún mayor. En cuanto la inferencia permanente corre en la muñeca, el indicador de espera del asistente de voz deja de ser un coste y pasa a ser lo básico, y los operadores de servicios de voz basados en ida y vuelta a la nube deben rehacer sus cálculos de costes. Para quienes usamos LLM locales en el escritorio, importa que sea el primer caso comercial donde las restricciones de energía ganan a las de software.