GPU 시세 · VRAM · 온디바이스 AI

从靠 Codex 创收的案例,到 ChatGPT 广告向亚洲扩张——今天精选的 6 条开发者视角新闻。不是甩链接了事:我读完原文,附上了每条新闻的关键数字和我的判断。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

1. Codex 做出了销售人员的演示——腾出工程师 40~60 小时

Proaction boosts sales 60% and saves 75+ hours with Codex

这是车队管理软件初创公司 Proaction 的故事。销售 COO 不是开发者,却把潜在客户的通话录音、邮件和电子表格扔进 Codex,然后带该公司车辆数据的交互式演示画面在 30~45 分钟内亲手完成,每月 4~6 个。若由工程师来做每个要 10 小时,每月可省 40~60 小时,从初次接触到进入实际方案开发阶段的成单比例提高了 50~60%。

我的判断:被标价的不是模型性能,而是瓶颈的转移这才是关键。做 demo 从工程师的排队任务,变成了销售人员的当场操作——如果预销售演示曾是你们公司的瓶颈,这套工作流拆解比任何性能表都更值得原样搬走。

2. Harvey 抬高法律草稿的上下文上限

Harvey turns legal context into stronger drafts with GPT-6 Astra

法律 AI 公司 Harvey 公开展示了新流程:把判例、顾问文书、披露资料等整个案卷的上下文纳入草稿生成,并用 memory 面板固定每位律师的偏好(编号列表、来源优先级、按优先级配色)。据称文档格式和上下文体现比之前的模型有明显改善。

我的判断:法律冲在最前面并非偶然 — 输入文档量大、输出格式严格,因此上下文长度与结构化即质量因为它就是会变成这样的领域。如果在本地跑 RAG 的话VRAM 基准表先算缓存预算。

3. invideo — 调色成功率 3 倍,每天 50 个定制特效

How invideo improves color grading 3x with GPT-6 Astra

Agent 式视频剪辑工具 invideo 的报告:只换背景、保持人物色调这类分离任务需要帧跟踪,以前失败率很高,现在成功率提高约 3 倍。靠描述加参考,一天做出约 50 个定制特效,而复杂剪辑更少的推理步骤和更少的输出 token以此来做规划。

我的判断:agent 成本的实质是推理步数。同一任务上输出 token 减少,意味着延迟和账单一起下降 — 如果选 agent,别看基准分数,要看它是否公开步数。

4. ChatGPT广告,新增东南亚·台湾7个市场——上线200天年化10亿美元

ChatGPT Ads expands to Southeast Asia and Taiwan

开始在印尼、马来西亚、菲律宾、新加坡、泰国、越南、台湾推出,累计超60国。一个数字:上线广告后不到200天年化营收10亿美元达成速度。重申了原则:广告只出现在免费和低价套餐,高价订阅无广告,对话内容不向广告主公开。韩国早已是上一轮灰度发布的对象。

我的判断:广告库存的价值来自购买咨询意向——这也是搜索广告贵的同一逻辑。对国内营销而言,这种形式已经落地韩国,是时候检查竞争对手在抢哪些咨询话术了。

5. Airbnb 在工程全线推广 GPT-6 Astra——文档工作从 20 轮降到 3~4 轮

Airbnb widens access to GPT-6 Astra and OpenAI frontier models

一直在编码 Agent 中使用 GPT-5.6 系列的 Airbnb,通过 API 和 Amazon Bedrock 通道把 Astra 的使用扩展到整个产品与工程组织。有意思的数据点:在战略文档(非编码)工作中,单个用户的产出达到其他模型 20 轮以上,这里 3~4 轮已缩短。

我的判断:大规模部署的胜负由轮次决定。这不是一个人省 1 小时,而是整个组织的排队问题,所以连过去不配合的团队预算也能批下来。

6. Transformers 直接运行 llama.cpp 量化——用 from_pretrained 加载 GGUF

Transformers now runs llama.cpp quants

Hugging Face Transformers 现在可直接加载 GGUF。通过 kernels 库复用 Ollama、LM Studio 底层的 ggml 内核,性能逼近 llama.cpp;首批优化对象是Apple Silicon 与 Qwen3.5 架构是(上文结论)。示例表:Qwen3.5-4B 从 BF16 8.42GB 到 Q4_K_M 2.74GB——建议以 Q4_K_M 为起点。

我的判断:GGUF 一直作为本地执行的事实标准运转,却与 Transformers 生态(数据集、运行器、评估)割裂。一旦这堵墙倒下,文件夹里待命的量化模型就会进入流水线。对 Mac 用户来说,这是从今天开始的事。

常见问题

演示自动化要从哪里开始准备?

Codex 环境本身就是前提条件,所以比起模型本身,通话录音、邮件、CRM 的对接配置才是第一步。若选本地替代方案,就把上下文收集自动化,生成则交给本地编码者指南请照此配置。

支持 GGUF,值得弃 Ollama 转投吗?

只做生成,Ollama 依然省事。需要把 GGUF 接进微调、评测、数据集流水线时,Transformers 这条路刚被打开。

ChatGPT 广告在韩国也已经上线了吗?

是 — 继澳大利亚、新西兰、日本、韩国、印度之后,又新增了东南亚 7 个市场。仅免费/低价套餐账号会被展示。

来源:以厂商官方发布和公开数据为准。价格与规格可能变动,请确认后决策。