今天模型新闻的关键词是”数字怎么量”:把 70B 腰斩的新压缩法、揭开创分背后协议的公开数据集,以及能真正落到我这张 4090 上的变化——我读完原文、算完账后整理如下。
🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
砍掉 70B 的 50%、保住 23 个百分点的 MMLU——把块移除变成一道物理题
Multiverse Computing 的帖子(9 月 21 日) 把「整体删除 Transformer 块」这一问题转化为名为 Ising glass(伊辛玻璃)的二值优化模型来求解。不同于切掉连续整块的既有方法,它只用校准数据跑前向·反向传播,对「保留哪些块」的组合进行排序。核心数值:Llama-3.3-70B 压缩 50% 时,MMLU 上比既有 SOTA 块删除法领先 23 个百分点;在 Nemotron-3-Nano-30B-A3B 这类块结构不均匀的模型上,也在 AIME25·GPQA 上超越了 SOTA。
我的判断:以单张 4090 为基准的计算很有意思。把 70B 的一半 35B 以 4 比特装载,仅权重就约 17.5GB——扣除 KV 缓存余量后勉强塞进 24GB,这是第一条’真正 70B 级’的路径。不过 50% 的压缩率不是无需重训就能得到的数字,基准分数也保证不了体感质量。但作为’连续块切分’实际上已过时的信号,这已经足够。
基准分数是曲线而非点 — UK AISI 公开协议的原因
英国 AISI 与 EvalEval 联盟发布(9 月 22 日)发布了HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0五个基准的已验证结果与配置信息,形式为Evaluation Cards。涉及模型为Claude Opus 4·4.5·4.6、GPT-5·5.2·5.4等6种。亮点是附带论文——Humanity’s Last Exam分数随推理token预算和协议呈曲线变化;给予正确答案反馈后,模型用的token越多,解出的题越多。
我的判断:榜单上一行字只要省略了「允许n个token」这个条件,就是营销话术。同一模型、同一基准,仅设置不同就分数不同,那么比较本身就得重新设计。我自己的本地实验里,同一模型用temperature 0.7和0.2跑体感就不一样——业界现在开始用文档承认这一点了。引用基准时,若没有设置链接,那个数字最好别用。
每周省 7 小时与每周 10 亿人——AI 使用数据告诉我们的事
OpenAIMentalHealthBench(9 月 23 日)正式发布。来自 22 个国家的 80 多名持照专家参与,基于周活跃用户 10 亿规模的真实使用模式生成合成对话,并从安全、上下文理解、用户自主性等 10 个维度打分。同一周,GoogleATLAS 新数据报告称近一半科学家每天使用 AI,每周约节省 7 小时;并统计出美国计算机与数学类职业占 AI 使用的 30%,是全球平均的 2 倍。
我的判断:7 小时是每周 40 小时的 17.5%——比”生产力革命”的文案诚实得多,也因此是个更大的数字。两场发布的共同点,是没有把测量外包给别人,而是自己设计。既然评分表已公开,今后的模型发布都得按这十个维度拆解接受检验。
浏览器推理的瓶颈不是模型而是内核——207 个 WebGPU 内核发布
Hugging Face@huggingface/kernels(9 月 1 日) 发布了 207 个 WebGPU 内核。每个内核都是具备清单、一致性测试和基准用例的独立仓库,并通过在浏览器里直接给 GPU 打分的 Fleet,采集实验室覆盖不到的真实硬件性能数据。同一oMLX 维护者 Jun Kim 加入也一并公布 — 这是首次设立 MLX 生态专职人员的案例。
我的判断:上层运行时不可能快过底层内核。把内核拆成可版本管理的积木,是浏览器推理从”演示”迈向”基础设施”的工程分水岭;而且都专门成立 Apple Silicon 团队了,我这台 M5 Mac 很快就会有副推理节点的用武之地。如果本地环境配置对你还陌生,我的本地安装指南即是出发点。
常见问题
块移除压缩模型现在就能下载吗?
帖子以方法和基准为主,是否提供成品 checkpoint 尚未确认。不过它仅靠校准(calibration)就能工作,属于社区会很快复现的那类研究。
70B 压缩 50% 能在 RTX 4090 上跑吗?
35B 按 4bit 约 17.5GB,理论上能进 24GB。但要给 KV 缓存和上下文长度留出余量,需要按 32K 以下使用的实测;各用途最低 VRAM 见我的基准表请通过……确认。
MentalHealthBench 分数低,就不能用做咨询 AI 吗?
OpenAI 自己也划了线:ChatGPT 不是心理治疗的替代品。这个基准衡量的是日常对话的整体质量,而非“危机应对规避”,所以分数只是参考指标,不是安全保证书。
来源:Hugging Face 官方博客、OpenAI 官方公告、Google AI & Economy ATLAS。数据以发布口径为准,后续复现结果可能不同。