GPU 시세 · VRAM · 온디바이스 AI

今天挑的3条模型·工具消息。不做只丢链接的简报——原文我亲自读过,每条下面附上开发者视角的关键数字和我的判断。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

代码模型画水彩画——用 TRL 和 OpenEnv 的开放复现(Hugging Face,09-03)

Training a coding model to paint watercolours with TRL and OpenEnv

原版是8月23日走红的一个视频。语言模型为p5.brush库写了约150行JavaScript,代码运行时画出水彩画。播放量150万。本篇在工程层面把整个配方开源复现——参考画风池、RL环境、训练脚本、训练好的模型全部上传到了hub。奖励设计的核心不是单独的图像评分器,而是把两个结果并排放置、判定画风接近度的pairwise judge结构。训练是Qwen3.5-35B-A3B加LoRA,H200上110步,一条命令。

我的判断:真正的信号不是画面,而是输出是代码这一点……要点在此。扩散模型的像素无法解读,但该模型的输出是 150 行 JavaScript — 每一笔的决策都可调试、可编辑。因为是撰写而非生成,放进流水线后可自由地局部修改并重跑。这是把本地 LLM 当作行为生成器而非单纯聊天工具这一方向上最干净的范例,想亲自跑 RL 环境的团队可以直接把它拆作环境脚手架。

ColBERT 式多向量嵌入,sentence-transformers 正式支持(Hugging Face,08-26)

Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers

sentence-transformers v6.0 新增第四种模型类型:多向量编码器。把查询和文档拆成每 token 一个向量、事后再交互的 ColBERT 式训练,现在一行安装即可实现。最精彩的是作者随帖子同步训练的医疗专用模型——一张 RTX 3090 上 14.5 小时经过微调,它在医疗检索基准 NDCG@10 上超越了 dense、sparse、lexical、多向量全部通用模型,而且参数量远小于其中最强的模型。

我的判断:当RAG检索是复现失败的瓶颈——即查询中只有特定片段应与文档匹配的情况——ColBERT系是正解,但此前训练管线停留在研究代码水平,落地受阻。这道壁垒消失才是新闻。「一张3090就够」这个数字也很重要——按本博客的标准,这是单张24GB卡内的活。如果你在跑公司内部文档RAG,这是值得重训的第一个候选。

Ringg 用 GPT-5.6 agent 自动解决 65% 客户通话 — 成本降低 90%(OpenAI,09-23)

Ringg’s AI agents resolve up to 65% of customer calls with OpenAI

这是一个服务印度消费级企业的语音/聊天 agent 平台的实测案例。每月接通 700 万通电话,最高 65% 由 agent 自行解决,客户满意度 4.8。最值得关注的部分是它并非单一模型结构这一点……就是这样。实时语音/聊天主干仍由 GPT-4.1 承担,需要低延迟时用 GPT-5.6 Luna,通话摘要和情感分析用 Terra,评估和 model-as-judge 用 Sol — 按任务路由,仅在”把实时工作负载从 4.1 迁移到 5.6″的部分就降本约 90%。对话在接近 8 万 token 时用结构化摘要压缩的上下文管理,以及混合语言通话中最高 97% 的准确率,也都以数字公开。

我的判断:标题里的”成本90%”不是整张账单,而是经路由改道的工作负载单价这才是重点。这里要学的不是价目表,而是路由表——把所有对话都塞给同一档模型,账单撑不住。仅把通话摘要、判定这类异步后处理挪到便宜模型上,就在保持平均质量的同时大幅降本。不在呼叫中心也一样——先怀疑那种把 agent 流水线每一环都买同一档的结构。

三条新闻的共同点——”一个大模型包打天下”的退场

图像模型往写代码方向走,检索走先切小、后交互的 late interaction,客服中心按任务拆分模型。三者都是把输出的单位、表示的单位、成本的单位拆开加以控制的架构。从本地运行的角度看VRAM 基准表重新读一遍,至于智能体的本地引擎DeepSeek·Qwen安装指南与其编码员的席位相连。

常见问题

学水彩风格复现需要多少 GPU?

原始配方是 H200 上 48 小时的任务,但因为用的是 LoRA,推理基准看的是模型装载量。35B-A3B 4 比特量化在 18GB 级别,统一内存 32GB 以上的 Mac 就能跑得动。奖励计算由评分 Space 代劳,所以并非全部在本地运行。

需要马上切换到多向量嵌入吗?

如果密集检索召回率已在目标区间,就没有更换的理由。当查询中某个特定片段始终与文档对不上的失败反复出现时,才是候选。代价是索引大小会按每文档向量数成倍增长。

把 Ringg 架构移植到国内服务时,瓶颈在哪?

不是延迟,而是接口的地形——预约、支付、CRM 的 API 各家不同,Ringg 式编排的相当一部分就是这些连接工作。模型单价的节省排在后面。

来源:厂商官方规格与公开流通价格。价格和规格可能变动,购买前请确认最新信息。