Tres noticias de modelos y herramientas de hoy. Nada de briefings de tirar enlaces: he leído los originales y bajo cada item dejo las cifras clave en clave de desarrollador y mi opinión.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
Un modelo de código pinta acuarelas: reproducción abierta con TRL y OpenEnv (Hugging Face, 09-03)
Training a coding model to paint watercolours with TRL and OpenEnv
El original es un vídeo que se hizo viral el 23 de agosto. Un modelo de lenguaje escribe unas 150 líneas de JavaScript para la librería p5.brush, y el código se ejecuta pintando una acuarela. 1,5 millones de visualizaciones. Este post reproduce la receta completa en abierto desde el punto de vista de la ingeniería: el pool de estilos de referencia, el entorno de RL, los scripts de entrenamiento y el modelo entrenado están todos en el hub. La clave del diseño de recompensas es una estructura de juez por pares que coloca los dos resultados uno junto al otro y juzga la proximidad de estilo, no un puntuador de imágenes a secas. Entrenamiento: LoRA sobre Qwen3.5-35B-A3B, 110 pasos en una H200, un solo comando.
Mi opinión: la señal real no es la imagen sinoQue la salida sea código…es la clave. No puedes leer los píxeles de un modelo de difusión, pero la salida de este modelo son 150 líneas de JavaScript — cada decisión de pincelada es depurable y editable. Como es escritura, no generación, al meterlo en un pipeline puedes editar parcialmente y reejecutar con libertad. Es el ejemplo más limpio de usar un LLM local como generador de acciones y no como mero chat, y un equipo que quiera probar su propio entorno RL puede reutilizarlo tal cual como andamiaje del entorno.
Embeddings multivector estilo ColBERT, soporte oficial en sentence-transformers (Hugging Face, 08-26)
Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers
sentence-transformers v6.0 añadió los codificadores multivector como cuarto tipo de modelo. El entrenamiento estilo ColBERT —dividir consultas y documentos en un vector por token e interactuarlos después— ya es posible con una línea de instalación. Lo mejor: el modelo especializado en medicina que el autor entrenó a la vez que el post —14.5 horas en una sola RTX 3090Tras el fine-tuning superó a todos los modelos de propósito general —denso, disperso, léxico y multivector— en NDCG@10 del benchmark de recuperación médica, y con muchos menos parámetros que el modelo más fuerte.
Mi opinión: cuando la recuperación RAG es el cuello de botella de los fallos de reproducción —casos donde solo un tramo concreto de la consulta debe coincidir con el documento—, la familia ColBERT es la respuesta, pero hasta ahora el pipeline de entrenamiento era código de investigación y bloqueaba su adopción. La noticia es que esa barrera cae. También importa el dato de que basta una 3090: según este blog, es un trabajo dentro de una sola tarjeta de 24GB. Si montas RAG sobre documentación interna, es el primer candidato a reentrenar.
Ringg resuelve automáticamente el 65% de las llamadas de clientes con agentes GPT-5.6 — coste reducido un 90% (OpenAI, 09-23)
Ringg’s AI agents resolve up to 65% of customer calls with OpenAI
Es un caso medido de una plataforma de agentes de voz/chat al servicio de empresas de consumo indias. 7 millones de llamadas conectadas al mes, hasta el 65% resueltas por el propio agente, satisfacción del cliente 4.8. Lo más destacable esQue no es una estructura de un solo modelo…es el esquema. El grueso de voz/chat en tiempo real sigue en GPT-4.1; GPT-5.6 Luna cuando hace falta baja latencia, Terra para resumen de llamadas y análisis de sentimiento, Sol para evaluación y model-as-judge — enrutando por tarea se recortó el coste un 90% solo en la parte donde “las cargas en tiempo real se movieron de 4.1 a 5.6”. La gestión de contexto que comprime la conversación en resúmenes estructurados cerca de los 80k tokens, y hasta un 97% de precisión en llamadas con idiomas mezclados, también se publican en cifras.
Mi opinión: el “90% del coste” del titular no es la factura completa, sinoCoste unitario de las cargas reasignadas por enrutadoeso es lo importante. Lo que hay que aprender aquí no es la lista de precios sino la tabla de enrutamiento: la facturación no aguanta pasar todas las conversaciones por un único nivel de modelo. Basta con mover el postprocesado asíncrono —resúmenes de llamadas, veredictos— a modelos baratos para recortar costes a fondo manteniendo la calidad media. Igual fuera de los call center: desconfía primero de cualquier pipeline de agentes donde cada etapa compre el mismo nivel.
Lo que comparten las tres noticias: el fin del modelo-grande-lo-arregla-todo
Modelos de visión hacia escribir código, recuperación hacia interacción tardía —dividir en pequeño y cruzar después—, centros de contacto dividiendo modelos por tarea. Los tres son arquitecturas que controlan fragmentando la unidad de salida, la unidad de representación y la unidad de coste. Desde la óptica de la ejecución localTabla de referencia de VRAMy vuelve a leerlo así; el motor local del agente esGuía de instalación de DeepSeek·Qwense conecta con su puesto de codificador.
Preguntas frecuentes
¿Cuánta GPU hace falta para entrenar la reproducción de acuarela?
La receta original es un trabajo de 48 h en H200, pero al ser LoRA, la referencia de inferencia es el tamaño de carga del modelo. La cuantización a 4 bits de 35B-A3B ronda los 18 GB: tamaño viable en un Mac con 32 GB o más de memoria unificada. El cálculo de recompensas lo asume el Space del scorer, así que no todo se ejecuta en local.
¿Debo cambiar ya a las incrustaciones multivector?
Si el recall de la recuperación densa ya está en el rango objetivo, no hay razón para cambiar. Es candidato cuando se repiten los fallos en que una frase concreta de la consulta nunca encuentra el documento. También está el coste de que el tamaño del índice crezca según el número de vectores por documento.
¿Cuál es el cuello de botella al portar la arquitectura Ringg a servicios locales?
No es la latencia: es el terreno de conectores. Las APIs de reservas, pagos y CRM varían según la empresa, y buena parte de la orquestación estilo Ringg es ese trabajo de integración. Ahorrar en precio de modelo viene después.
Fuentes: especificaciones oficiales del fabricante y precios de distribución públicos. Precio y especificaciones pueden cambiar: revisa lo último antes de comprar.