La noticia de modelos de hoy va de cómo se miden los números: una nueva compresión que reduce un 70B a la mitad, un dataset abierto que destapa el protocolo tras las puntuaciones, y los cambios que sí llegarán a mi 4090. He leído las fuentes y hecho las cuentas.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
Cómo recortar un 70B un 50% y conservar 23 puntos de MMLU: convertir la eliminación de bloques en un problema de física
Publicación de Multiverse Computing (21 de septiembre) aborda el problema de borrar bloques transformer completos mediante un modelo de optimización binaria llamado vidrio de Ising. A diferencia de los métodos previos que cortan trozos contiguos, ejecuta solo pases hacia adelante y hacia atrás con datos de calibración para clasificar combinaciones de «qué bloques conservar». Cifras clave: comprimir Llama-3.3-70B un 50% supera a los métodos SOTA previos de eliminación de bloques en 23 puntos en MMLU, e incluso en modelos de estructura de bloque heterogénea como Nemotron-3-Nano-30B-A3B supera el SOTA en AIME25 y GPQA.
Mi opinión: el cálculo por 4090 es interesante. Montar 35B —la mitad de 70B— en 4 bits requiere unos 17,5 GB solo en pesos; descontando el margen de la caché KV entra justo en 24 GB: la primera vía de ‘clase 70B’ real. Pero una compresión del 50% no es un número sin reentrenar, y las puntuaciones de benchmark no garantizan la calidad percibida. Aun así, basta como señal de que el ‘corte de trozos contiguos’ ha caducado de facto.
Las puntuaciones de benchmark son curvas, no puntos — por qué UK AISI publicó el protocolo
Publicado por UK AISI y la EvalEval Coalition (22 de septiembre)ha publicado las Evaluation Cards con resultados verificados y detalles de configuración de cinco benchmarks: HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro y Terminal-Bench 2.0. Los modelos incluidos son Claude Opus 4·4.5·4.6, GPT-5·5.2·5.4 y seis en total. Lo mejor es el paper anexo: las puntuaciones de Humanity’s Last Exam se movían en curva según el presupuesto de tokens de inferencia y el protocolo, y con feedback de respuesta correcta los modelos resolvían más problemas cuanto más tokens usaban.
Mi opinión: una línea de leaderboard es marketing en cuanto se omite la condición «se permiten n tokens». Si el mismo modelo en el mismo benchmark puntúa distinto solo por cambiar la configuración, hay que rediseñar la comparación en sí. En mis pruebas locales, el mismo modelo a temperature 0.7 y 0.2 ya se siente distinto; la industria apenas empieza a reconocerlo por escrito. Al citar un benchmark, si no hay enlace a la configuración, ese número es mejor no usarlo.
7 horas ahorradas a la semana y 1,000 millones de personas: lo que dicen los datos de uso de IA
OpenAIMentalHealthBench (23 de septiembre) ha sido publicado. Participaron más de 80 profesionales con licencia de 22 países; se generan conversaciones sintéticas a partir de patrones de uso reales de una escala de 1000 millones de usuarios semanales y se puntúan en 10 dimensiones como seguridad, comprensión del contexto y autonomía del usuario. Esa misma semana GoogleDatos nuevos de ATLAS informa de que casi la mitad de los científicos usan IA a diario y ahorran unas 7 horas semanales, y que en EE. UU. las ocupaciones de informática y matemáticas suponen el 30% del uso de IA, el doble de la media mundial.
Mi opinión: 7 horas son el 17,5% de una semana de 40 horas: mucho más honesto que el eslogan de ‘revolución de la productividad’ y, por eso, un número mayor. Ambas presentaciones comparten algo: midieron con diseño propio, sin tercerizar. Con el marcador ya público, los próximos lanzamientos tendrán que validarse desglosados en estas diez dimensiones.
El cuello de botella de la inferencia en navegador eran los kernels, no el modelo: 207 kernels de WebGPU liberados
Hugging Face@huggingface/kernels (1 de septiembre) publicó 207 kernels WebGPU. Cada kernel es un repositorio independiente con manifiesto, pruebas de conformidad y casos de benchmark, y un Fleet que puntúa las GPUs directamente en el navegador recoge datos de rendimiento de hardware real que el laboratorio no cubre. En el mismoSe une Jun Kim, mantenedor de oMLXtambién se anunció — el primer caso de personal dedicado al ecosistema MLX.
Mi opinión: un runtime nunca puede ser más rápido que sus kernels. Convertir los kernels en piezas Lego versionables es el punto de inflexión en que la inferencia en navegador pasa de ‘demo’ a ‘infraestructura’, y con personal dedicado a Apple Silicon, mi Mac M5 pronto tendrá hueco como nodo de inferencia secundario. Si montar un entorno local te resulta ajeno, miGuía de instalación locales el punto de partida.
Preguntas frecuentes
¿Puedo descargar ya los modelos comprimidos por eliminación de bloques?
El post se centra en metodología y benchmarks, así que no está confirmada la publicación de un checkpoint terminado. Pero como funciona solo con un pase de calibración, es el tipo de investigación que la comunidad reproducirá rápido.
¿Funciona en una RTX 4090 un 70B comprimido al 50%?
35B a 4 bits son unos 17.5GB, así que teóricamente entra en 24GB. Pero para dejar margen a la caché KV y la longitud de contexto hacen falta mediciones usándolo a 32K o menos, y el VRAM mínimo por uso está enMi tabla de referenciacompruébalo en
Si puntúa bajo en MentalHealthBench, ¿no debería usarse para IA de consejería?
La propia OpenAI marca el límite: ChatGPT no sustituye a la terapia. Este benchmark mide la calidad general de la conversación cotidiana, no la gestión de crisis, así que las puntuaciones son una referencia, no un certificado de seguridad.
Fuentes: blog oficial de Hugging Face, anuncio oficial de OpenAI, Google AI & Economy ATLAS. Las cifras son las anunciadas y pueden variar según resultados de réplica posteriores.