GPU 시세 · VRAM · 온디바이스 AI

这六篇我都亲自读了。客户案例是广告,但广告里藏着数字。我只把数字挑出来,按韩国人工成本换算成盈亏。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

把 Codex 案例按韩国人力成本折算

1. Proaction boosts sales 60% and saves 75+ hours with Codex

这是车辆管理初创公司 Proaction 的分享。一位非开发者的联合创始人把销售通话录音、邮件和电子表格喂进 Codex,在 30 到 45 分钟内做出了一个完全按客户车辆配置还原的演示,每月省下 40~60 小时工程时间,营收增长 60%。

真正的数字不是 60%,而是时间。韩国开发者 6000 万韩元年薪,折算成含四大保险和管理费的用人成本,大约每小时 3 万韩元。每月 50 小时就是 150 万韩元。AI 工具的席位费在这个数字面前只是玩具。但真正的冲击在别处:演示制作从通常的两天缩到 30 分钟,这个差距就是报价速度,就是管线数量本身。

韩国 B2B 组织该偷的不是工具,而是结构。只要需求定义和演示制作分属不同部门,这场会议就保不住报价速度。部门改不了,那就至少让销售负责人亲手用起来一块自己写的看板。

GPT-6 Astra 三个案例的共同关键词:上下文是资产,推理步骤是成本

2. Harvey 如何把法律上下文变成草稿质量

在法律 AI 公司 Harvey 公布的内容里,最抢眼的不是模型性能,而是 memory 面板。它把每位律师的偏好——编号列表、EDGAR 优先、优先级配色之类的规则——存下来并在草稿中贯彻。这个结构比“上下文窗口变长了”的说法更重要。

因为模型谁都能买,偏好数据却是自己的。三年后法律 AI 的差距,不取决于模型,而取决于谁掌握了各律所偏好的积累。对韩国律所和法律科技公司,问题也一样:今天律师嘴里说出的修改意见,有没有被登记成数据,还是改完就算?只有登记下来的才会积累。

3. invideo:调色成功率提升 3 倍的账本

视频剪辑 agent invideo 发布了色彩校正类成功率提升 3 倍。比那句话更让人按下计算器的,是另一句:同样的任务用少得多的推理步骤就完成了。

在 Agent 产品里,推理步骤就是实打实的营业成本。把 20 步的任务压到 4 步,该服务的毛利率就按步骤减少的倍数跳升。这一系列要当作成本结构重组公告来读,而不是性能发布会。自己跑 agent 的团队,请把今天同类任务的平均步数统计下来。半年后的模型代际对比表里,这个数字会替你证明单位经济性。

4. Airbnb 宣布扩大模型接入时公布的两个数字

核心是两个数字。不是写代码,而是做策略文档:别的模型要改 20 多次,它 3~4 次搞定。而且不增员,上线功能同比多了 80%。

第一个数字会改变企业合同谈判的顺序:要对赌的是每次尝试的成功率,而不是每席位价格——4 次就能搞定的事不能付 25 次的钱。该写进合同的条目不是用户数,而是通过次数。第二个数字是冻结招聘组织的逻辑:招聘被卡住时,人均产出的增长就是招聘,80% 就是那张证明。

ChatGPT广告:韩国已经不在局内

5. ChatGPT Ads expands to Southeast Asia and Taiwan

这次的消息是新增东南亚 7 国,但韩国其实早已在此前的推送范围内。广告只出现在免费和 Go 套餐上,Plus、Pro、Enterprise 无广告。代理方已接入 dentsu、Publicis、WPP。

本质在于购买语境正从搜索框关键词转向对话段落。即便是同样的商品咨询,聊天中的话语长度要长两倍以上,广告素材和落地页长度也得随之加长。搜索版面已饱和,竞价单价本就昂贵;对话式尚处早期,相对便宜。对国内营销人员而言,本季度的实验课题只有一个:从搜索广告预算中切出 5% 投到对话式,并以同一口径比较转化率。

transformers 吞下了 GGUF:瓶颈转移到 RAM

6. Transformers now runs llama.cpp quants

Hugging Face 宣布 GGUF 可直接通过 from_pretrained 加载。速度上通过复用 llama.cpp 的 ggml 内核来保证,并附上了 Qwen3.5 4B 从 BF16 8.42GB 缩减到 Q4_K_M 2.74GB 的表格。首要支持 Apple Silicon 和 Qwen3.5 架构,用 transformers serve 还能起 OpenAI 兼容服务器。

硬件角度的结论只有一个:当 llama.cpp 独占的性能与标准 Python 生态融合的那一刻,本地推理就从实验室装备变成开发者的必备装备。第一瓶颈不是 GPU,而是统一内存容量。已有在 32GB MacBook 上跑 27B 级模型的案例被引用。这与「DRAM 现货价是 AI 周期的先行指标」的观点完全吻合。连我之前猛夸的 4090,最终也绕回下一代内存容量的问题。

所以建议很简单。下次装机时,与其升一档显卡,不如加一档内存。趋势不是模型在变小,而是朝同一内存上装更多的方向走。