GPU 시세 · VRAM · 온디바이스 AI

我读了三篇报道,自己按计算器重新写了一遍。事实和数字取自原文和市场数据,算式和结论出自本文。算错的地方请在评论里指出。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

无服务器 vs 我的 4090:计算比文章更进了一步

1. 「弹性与成本」——serverless AI的两副面孔

文章的梳理是这样:负载波动大就用serverless,24小时稳定就用独享设备。形式没错。但套用2026年韩国价格表,结论就动摇了。以Joonggonara为准,RTX 4090平均市价₩356万。内存紧缺推高新卡价格,二手跟着涨——买方优势已经结束的市场。

这是我算过的账:356 万韩元按 36 个月折旧,每月 9.9 万韩元。电费:推理平均 0.35kW 24 小时运行,每月 252kWh,按住宅高累进档 250 韩元算,每月 6.3 万韩元。合计每月约 16 万韩元。同一张卡上,13B 级量化模型每秒 25 token,保守估计每月产出 6,500 万 token,每百万 token 约 2 韩元。对简单的文档分类和代码辅助来说,性能还有富余。

文章没说出口的结论在这里:如果你每月为按量计费推理 API 支付超过 20 万韩元,那么凡是 13B 级模型能替代的任务,本地早已压倒性地更便宜。所以选择无服务器的真正理由不是成本,而是最新模型的性能和零运维。问题要换:别问价格,要问比例——你的工作负载里有多少百分比可以推给小模型?这个比例一旦超过 70,账单就不是策略而是漏钱;低于 30 的团队留在无服务器是对的。分界点不是模型大小,而是任务难度分布。

文章没提的一个变量。在HBM和DDR同涨的周期里,GPU不再是耗材,而成了有残值的资产。所有权的折旧表里多出了一行对冲。也立下反证条件:一年后二手4090市价跌破₩356万,这套逻辑就是错的。

英伟达·联发科:不是杀死对手的一招,而是做大牌局的一招

2. 英伟达向联发科投资 35 亿美元,锁定 AI 基础设施主导权

英伟达买下联发科 35 亿美元可转债,联发科采用 NVLink Fusion。机架级基础设施、PC SoC、车载三线合作。评论在谈锁定效应,我认为先算清楚赌注。

英伟达没有阻止超大规模厂商为摆脱 GPU 而自研芯片的潮流,而是把它们编进自己的互连体系。客户一边自研芯片,一边继续购买 NVLink 和机架网络,联发科将设计的芯片里照样用 HBM。这等于在逻辑竞争上搭起 AMD 跨不过的桥,同时把内存需求这块蛋糕做大。从 SK 海力士的角度看内存蛋糕在变大,稳赚不赔——实际上今天收盘价涨幅也大于三星。

证据会在下一季度的供应链报告中得到确认。若联发科定制加速器的订单坐实,台积电稼动率会上升,但 HBM 器件用量不分平台。我的判断是:这笔合约是内存出货量新闻,而非逻辑芯片新闻。

Apple Watch 全天候聆听:不是电池常数问题,而是 NPU 常数问题

3. 持续聆听但不录音,苹果公开 AI 隐私方案

要点就两句话。S11 处理器不耗电就常时处理语音。不保留语音原始数据,只处理文本。然而这套设计真正的瓶颈并不是电池。

如果不保留原始音频,回看 15 秒前所说内容的实时回放原理上就不成立。「只保留文本」意味着在源头就切断,支撑它的是超低功耗的常开语音管线,归根到底是 NPU 与 SRAM 带宽设计。苹果一旦让这在手腕上成立,留给对手的战争就不是语音识别性能,而是每瓦推理量。

对开发者的冲击更大。一旦手腕上随时都在跑推理,语音助手的常开待机指示就不再是成本,而是基本功;以云端往返为前提的语音服务商必须重算成本账。对我们这些在书桌上烧本地 LLM 的人来说,意义在于:这是第一个功耗约束战胜软件约束的商业案例。