物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.31 · 周一

第 033 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1腾讯把旗舰大模型开源白送:能写代码、能一次读完一部长篇小说,但「赢了」的成绩单要冷静看

8 月 28 日,腾讯发布并开源新一代旗舰大模型 Hy4 preview——开源意味着代码和模型免费公开,谁都能下载自己部署。它有 7700 亿总参数、但每次回答只唤醒 490 亿(相当于脑子很大、每次只想一小部分,所以跑得快),一次能读 100 万字级别的内容(约一部长篇小说),定位是干实在活:写代码、办公分析、做游戏原型、搞科研。官方晒的成绩单是一场盲测:163 位专家、203 个真实工程任务,Hy4 得 2.99 分(满分 4 分),略高于智谱 GLM-5.3 的 2.92 和月之暗面 Kimi K3 的 2.94。定价输入约 6 元、输出约 18 元(每百万字),腾讯的 AI 办公台 WorkBuddy 先免费开放两周。

编程领域专家·老徐说|老规矩,自报成绩单先打折。0.05 分在 4 分制里就是「互有胜负」,而且 163 位评审全是腾讯自己的专家。真正有第三方痕迹的只有一个数:SWE-bench Pro(让 AI 在真实 GitHub 项目里修 Bug 的考卷)65.7%,总榜第 7、开源第 2,这个比盲测实在。吞吐提升 31.8% 连对照基准都没给,先不当真。延续我说了十五年的那句:跑分归跑分,拿你自己的任务跑一周,别急着上生产。

小编小禾说|免费两周这个羊毛我先薅为敬,去 WorkBuddy 试把会议纪要扔给它整理。但记住我 022 期翻过的车:看到「以微弱优势领先」的宣传先别转发,去翻原始报告。我试完回来汇报它到底好不好使,重要的活儿照旧留给我用了半年的那家。

来源:人民网 / 腾讯混元官方(2026-08-29)

重点 2霸榜一周的神秘模型「牛来」被认领了:智谱说这是我的 GLM-5.3-Flash,背后跑的是国产芯片

8 月 20 日,一个没有名字的模型「Ox Alpha」(网友昵称「牛来」)悄悄出现在全球开发者常用的 AI 模型调用平台上,上线首日冲调用量第一,终结了 DeepSeek 连续 56 天的榜首;截至 8 月 23 日,它一周的用量达到 11.6 万亿字,跟 DeepSeek 并列第一,预览期间还完全免费。8 月 28 日至 29 日谜底揭晓:智谱确认这是自家新开源的 GLM-5.3-Flash——3200 亿参数、每次只激活 180 亿,首款原生能看图的多模态开源模型,官方称综合智能评分与 Claude Opus 4.8 持平,价格只有旗舰的零头。智谱确认服务跑在数万张国产芯片上,免费期每天备了 100 万亿字的供给容量。

产品领域专家·阿哲说|025 期我写过这个「牛来」匿名霸榜的事,如今剧本走完闭环:匿名上架、免费压测、开发者用脚投票、厂商认领开源——「匿名旗舰测试+流量验证+开源放量」已经是这两年大厂发旗舰的标准预热范式。值得记住的是最后一步:官方敢确认的底气不是海报,是每天 100 万亿字的真实承接。国产模型的竞争已经从「谁跑分高」卷到「谁扛得住全球开发者白嫖式压测」,这比任何榜单都诚实。延续我的判断:哪个品类的打分权从厂商手里拿回来,哪个品类就迎来分水岭——这次是开发者抢回了打分权。

小编小禾说|当初全网猜它是谁家模型的时候我也跟着破案了,猜错。现在答案揭晓,我反而关心认领之后还免不免费、高峰卡不卡。老教训继续:新榜单名次会晃,先别急着把主力工具换过去,等它稳一两轮再说。

来源:新浪财经 / 智谱官方(2026-08-29)

重点 3OpenAI 承认:约 3% 的旗舰订阅请求被悄悄「换脑」,多付的钱买了小号 AI

8 月 28 日,OpenAI 公开承认:此前一段时间,约 3% 的 Pro/Thinking 高价订阅请求被错误地路由给了轻量模型 GPT-5.5-mini——换句话说,付着旗舰的钱,有大约三十分之一的机会在不知情的情况下收到「降级版」回答。OpenAI 称已修复并致歉。这件事值得每个 AI 付费用户看懂一层常识:你订的 AI 服务不是一个龙头放水,中间有一层「路由」,「你指定的模型」和「实际回答你的模型」是两回事。

安全领域专家·老周说|这不是偶发,是「可审计性缺位」的常规样本:服务方证明不了每一单会话用的是哪个模型,用户就无从发现。021 期 Copilot 的确认框能被链接参数绕过,我说 AI 助手不是保险箱;这次不是谁攻击了它,是路由自己走错门——边界不清的另一种形态。值得肯定的是厂商主动披露并致歉,这比藏着掖着的行业惯例强。用户能做的:重要产出明显变笨时,别怀疑自己,记下时间对照官方事故报告——行为审计这事,你自己就是最后一道审计。

小编小禾说|我看到这条的第一反应是:难怪有几次它突然变笨变慢,原来不是我的错觉!但这 3% 是厂商自己认的,没认的呢?学乖了:重要的活儿同一道题丢给两家 AI 对答案,差得离谱就要留个心眼,延续我那句「AI 的话信之前先验一遍」。

来源:知乎 · AI 精选日报(2026-08-28)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲测榜(Arena)分榜开新卷:视觉榜头名易主、阿里新旗舰第 2;写代码榜 27B 小模型杀进前 9

#视觉榜模型厂商分数(对战数)
1claude-fable-5Anthropic1312(9562 场)
2qwen3.8-max阿里1302(6743 场)
3claude-opus-4-7-highAnthropic1301(21122 场)
8muse-spark-1.2 (xHigh)Meta1292(仅 1853 场)

大白话|主榜快照没更新(仍停在 8 月 26 日,与上期同源,不照搬),本期改看两张上期没细讲的官方分榜:视觉榜(快照 8 月 21 日)头名从 Claude Opus 系列换成 claude-fable-5,阿里 qwen3.8-max 以 1302 分坐第 2——中国厂商在「看图说话」这条线上第一次摸到榜眼;写代码榜里 27B 档的 qwen3.8-27b 排第 9(1595 分),小模型能进前十说明「性价比档位」正在被认真打分。提醒一句:Meta 的 muse-spark-1.2 只有 1853 场对战,样本比头部薄一个量级,这个名次先别当定论。

快报 2综合智能榜 BenchAlign(快照 8 月 29 日):Anthropic 包揽前三,但看点是「谁最划算」

#模型厂商综合分(满分 100)
1Claude Mythos 5Anthropic83.4
2Claude Fable 5Anthropic83.15
3Claude Opus 5Anthropic83.06
—Kimi K3月之暗面达榜首 97%,输出价低 70%

大白话|这是把 408 张考卷汇总打分的综合榜,8 月 29 日刷新。Anthropic 一口气包揽前三,但前三名分差都落在误差线以内,大白话:这三家是一个水平线。真正扎眼的是 Kimi K3:能力约是榜首的 97%,价格便宜七成。选择题从「谁最强」变成「谁最划算」。

快报 3新模型扎堆卡(8 月 26-28 日三天四款,均有原始出处核验)

#日期模型一句话看点
18/28Hy4 preview(腾讯混元)7700 亿参数开源旗舰,免费两周
28/28GLM-5.3-Flash(智谱)「牛来」真身,原生能看图
38/28Ling 3.0 Flash Fin(InclusionAI)同门前作本周实测输出速度第一
48/26Qwen3.8-Flash-Next(阿里)1250 亿参数每次只激活 60 亿

大白话|三天四款新模型,三款来自中国厂商。发布名单取自独立追踪站的「已核实发布」列表,每条都有原始出处。上期我们说「新名次先看它晃不晃」,这一波直接把考场挤满——下一期盲测榜更新,头部的座位大概率要动。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

「模型换代不通知」有了观测站:苹果每次系统更新,手机里的 AI 都在悄悄换脑

开发者社区 8 月 31 日热了一个叫 UNDERFOOT 的观测站:从 2026 年 7 月起持续记录苹果设备内置的基础模型,发现每推一次系统更新,手机里那个「本地 AI」的行为特征就会变——同一个问题,上个月和这个月的模型可能不是同一个。端侧 AI「换代不通知」第一次有了第三方留档。

一句话点评|老周那句「可审计性缺位」的端侧版本:你手机里的模型会悄悄变,好在现在有人替你记账了。

来源:Hacker News / UNDERFOOT 观测站(2026-08-31)

研究扫描 6000 个代码库发现:AI 编程助手会照着「坟场包名」去下载安装

安全研究人员 8 月 31 日公布结果:在企业代码库里找到 120 个已废弃、无人认领的软件包引用,AI 编程智能体在被要求补全依赖时,会老老实实照着这些早被原作者放弃的包名去下载安装——这正是供应链投毒者等的时刻。AI 写代码快,但它不认识「这个包已经死了三年」。

一句话点评|延续 021 期「来路不明的链接别乱点」:现在是 AI 替你点了来路不明的包,人审依赖清单这关省不掉。

来源:forgeeks.net(2026-08-31)

字节视频模型「一哥」满月考:Seedance 2.5 被「平替」围攻,用户评价两极

8 月 31 日复盘:字节 Seedance 2.5 上线近一个月,两派声音打架——一派嫌贵(生成十几秒视频要几十块,个人创作者用不起),一派认它「地表最强视频生成模型,暂时无人超越」。真正的使用评测从来不发布会,在满月后的口碑里。

一句话点评|「最强」和「最贵」同时成立时,普通创作者的选择是等降价或等平替追上,先别囤会员。

来源:Tech星球 / 钛媒体(2026-08-31)

高通给出端侧新账本:手机里 1000 亿参数以内的 AI,能覆盖七成日常任务

8 月 30 日高通技术高管对国内媒体披露内部评估:300 亿参数级别的模型在 ARC-AGI-3(一类流体智力考试,考没见过的题会不会现学)上已表现相当好;1000 亿参数以内的端侧模型可覆盖个人和小企业 70%-80% 的日常任务,剩下交给云端。高通还在推把模型压得更小的 2bit 量化方案,已与中国厂商合作。

一句话点评|翻译成人话:多数 AI 活儿以后手机本地就能干,不必把数据传上网。但「70%-80%」是厂商自报口径,等第三方装机实测。

来源:智东西 / 凤凰科技(2026-08-30)

又一张综合聚合榜开张:Claude Opus 5 以 80.34 分居首,但看点在规则

独立聚合榜 AGI Ranker 把 10 张公开考试卷合成一个总分(满分 100),当前榜首 Claude Opus 5 得 80.34。它把「可独立验证优先于厂商自报」写进规则:第三方实测按 1.0 权重计入、厂商自述打七五折、查不到原始数据的直接标「证据核查中」而非编一个分数,所有修正公开留档。

一句话点评|名次会晃,规则值得抄:买 AI 看买家秀之前,先看这份榜单敢不敢标注「这条我核不了」。

来源:AGI Ranker(2026-08-31)

ChatGPT 首份学习报告:每周 7000 万条「学习对话」,写作业消息峰值 4.6 亿条/周

OpenAI 8 月 28 日发布 ChatGPT 学习使用报告:全球每周产生约 7000 万条以学习为目的的对话,作业相关消息周峰值达 4.6 亿条。

一句话点评|调用量是装不了假的投票——学生已经用起来了,课堂规则和考核方式的账还没算清。

来源:知乎 · AI 精选日报(2026-08-28)

数博会披露:我国日均词元(AI 处理字数)调用量突破 140 万亿

8 月 29 日开幕的数博会公布一组基线数据:我国 AI 大模型日均词元(可以粗略理解成 AI 每天处理输出的「字数」)调用量突破 140 万亿。你每天问 AI 的每句话,都计在这条大盘里。

一句话点评|大盘数字没有胜负手,但它是国产模型真实使用深度的底牌——比任何发布会 PPT 都硬。

来源:微博 · AIGC 日报(2026-08-29)

量化圈给 AI 研究员立了新规矩:回测分数漂亮不算数,得经得起「证据审计」

8 月 31 日量子位介绍的 AQuA 框架点破一个评测行业痛点:自主研究的 AI 系统跑出一条异常漂亮的回测曲线,量化研究员第一反应不是庆祝,而是先问「是不是用了未来数据、测试集有没有被反复偷看」。AQuA 把「分辨新证据还是一次偶然高分」做成系统能力,让研究 Agent 持续进化的同时,回测结果经得起检验。

一句话点评|评测方法论的好样本:分数会上涨,但「这个分数是不是刷出来的」才是要害——这条规矩适用于所有 AI 考卷。

来源:量子位(2026-08-31)

「这话是谁写的 AI?」盲测工具开张:比跑分更刁钻的考题来了

8 月 31 日上线的小工具 modelaccent 让各家模型按指定「口音」写作再盲测归属,顺手抛出一个评测观点:更快的模型可能让智能体反而更慢——token 速度不是承重指标,把任务闭环跑完才是。

一句话点评|从「答得对不对」考到「像不像人、办没办成事」,评测的考卷越来越像真实使用现场了。

来源:Hacker News / modelaccent.com(2026-08-31)

Anthropic 向独立研究者开放 Claude 使用数据:三家机构各拿约 25 万条对话

8 月 27 日前后,Anthropic 宣布向外部独立研究机构开放 Claude 的真实使用数据,三家研究机构各获约 25 万条对话样本,用于研究 AI 对用户的影响。

一句话点评|把黑箱打开一条缝给外人研究,透明度这种事,做一次算一次加分。

来源:知乎 · AI 精选日报(2026-08-28)

大家都在看 · HOT

●  OpenAI 承认约 3% 旗舰请求被错路由到小模型,已修复致歉(知乎日报)

●  研究实锤:AI 编程助手会照着已废弃的包名去下载安装(forgeeks)

●  Arena 分榜开新卷:视觉榜 qwen3.8-max 第 2、写代码榜 27B 进前 9(快照 8/21)

●  量化研究 Agent 立新规:回测高分先过「证据审计」再算数(量子位)

●  「模型换代不通知」有观测站了:苹果每次系统更新都在悄悄换端侧模型(HN)

明日关注 · TOMORROW

①  Arena 盲测榜下一份快照(主榜截至 8 月 26 日):盯 GLM-5.3-Flash、Hy4 能否上榜,视觉榜 qwen3.8-max 第 2 的位次在新快照里稳不稳

②  代号 Astra 的「GPT-6」周四发布在即:灰测 demo 刷屏之后,官方成绩单会带哪些基准分,等它把考卷晒出来再信

③  腾讯 Hy4 免费窗口第二周(到 9 月 10 日):WorkBuddy 首日就排队扩容,扛不扛得住真实用量、会不会限流,看这周用户口碑

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.31 · 周一

第 033 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1腾讯把旗舰大模型开源白送:能写代码、能一次读完一部长篇小说,但「赢了」的成绩单要冷静看

它能帮你干什么活:8 月 28 日,腾讯发布并开源新一代旗舰大模型 Hy4 preview——「开源」意味着代码和模型免费公开,谁都能下载自己部署。它有 7700 亿总参数、但每次回答只唤醒 490 亿(相当于脑子很大、每次只想一小部分,所以跑得快),一次能读 100 万字级别的内容(约一部长篇小说),定位是干实在活:写代码、办公分析、做游戏原型、搞科研。官方晒的成绩单是一场盲测:163 位专家、203 个真实工程任务,Hy4 得 2.99 分(满分 4 分),略高于智谱 GLM-5.3 的 2.92 和月之暗面 Kimi K3 的 2.94。定价输入约 6 元、输出约 18 元(每百万字),腾讯的 AI 办公台 WorkBuddy 先免费开放两周。

编程领域专家·老徐说|老规矩,自报成绩单先打折。0.05 分在 4 分制里就是「互有胜负」,而且 163 位评审全是腾讯自己的专家。真正有第三方痕迹的只有一个数:SWE-bench Pro(让 AI 在真实 GitHub 项目里修 Bug 的考卷)65.7%,总榜第 7、开源第 2,这个比盲测实在。「参与了自己的训练」那句听着吓人,吞吐提升 31.8% 连对照基准都没给,先不当真。想接进项目的朋友,官方列的 12 项考试全是自述——延续我说了十五年的那句:跑分归跑分,拿你自己的任务跑一周,别急着上生产。

小编小禾说|免费两周这个羊毛我先薅为敬,去 WorkBuddy 试把会议纪要扔给它整理。但记住我 022 期翻过的车:看到「以微弱优势领先」的宣传先别转发,去翻原始报告。我试完回来汇报它到底好不好使,重要的活儿照旧留给我用了半年的那家。

来源:人民网 / 腾讯混元官方(2026-08-29)

重点 2霸榜一周的神秘模型「牛来」被认领了:智谱说这是我的 GLM-5.3-Flash,背后跑的是国产芯片

它能帮你干什么活:8 月 20 日,一个没有名字的模型「Ox Alpha」(网友昵称「牛来」)悄悄出现在全球开发者常用的 AI 模型调用平台上,上线首日冲调用量第一,终结了 DeepSeek 连续 56 天的榜首;截至 8 月 23 日,它一周的用量达到 11.6 万亿字,跟 DeepSeek 并列第一,预览期间还完全免费。8 月 28 日至 29 日谜底揭晓:智谱确认这是自家新开源的 GLM-5.3-Flash——3200 亿参数、每次只激活 180 亿,首款原生能看图的多模态开源模型,官方称综合智能评分与 Claude Opus 4.8 持平,价格只有旗舰的零头。智谱确认服务跑在数万张国产芯片上,免费期每天备了 100 万亿字的供给容量。

产品领域专家·阿哲说|025 期我写过这个「牛来」匿名霸榜的事,如今剧本走完闭环:匿名上架、免费压测、开发者用脚投票、厂商认领开源——「匿名旗舰测试+流量验证+开源放量」已经是这两年大厂发旗舰的标准预热范式。值得记住的是最后一步:官方敢确认的底气不是海报,是每天 100 万亿字的真实承接。国产模型的竞争已经从「谁跑分高」卷到「谁扛得住全球开发者白嫖式压测」,这比任何榜单都诚实。延续我的判断:哪个品类的打分权从厂商手里拿回来,哪个品类就迎来分水岭——这次是开发者抢回了打分权。

小编小禾说|当初全网猜它是谁家模型的时候我也跟着破案了,猜错。现在答案揭晓,我反而关心认领之后还免不免费、高峰卡不卡。老教训继续:新榜单名次会晃,先别急着把主力工具换过去,等它稳一两轮再说。

来源:新浪财经 / 知乎 AI 精选日报(2026-08-29)

重点 3OpenAI 承认:约 3% 的旗舰订阅请求被悄悄「换脑」,多付的钱买了小号 AI

它能帮你干什么活:8 月 28 日,OpenAI 公开承认:此前一段时间,约 3% 的 Pro/Thinking 高价订阅请求被错误地路由给了轻量模型 GPT-5.5-mini——换句话说,付着旗舰的钱,有大约三十分之一的机会在不知情的情况下收到「降级版」回答。OpenAI 称已修复并致歉。这件事值得每个 AI 付费用户看懂一层常识:你订的 AI 服务不是一个龙头放水,中间有一层「路由」,「你指定的模型」和「实际回答你的模型」是两回事。

安全领域专家·老周说|这不是偶发,是「可审计性缺位」的常规样本:服务方证明不了每一单会话用的是哪个模型,用户就无从发现。021 期 Copilot 的确认框能被链接参数绕过,我说 AI 助手不是保险箱;这次不是谁攻击了它,是路由自己走错门——边界不清的另一种形态。值得肯定的是厂商主动披露并致歉,这比藏着掖着的行业惯例强。用户能做的:重要产出明显变笨时,别怀疑自己,记下时间对照官方事故报告——行为审计这事,你自己就是最后一道审计。

小编小禾说|我看到这条的第一反应是:难怪有几次它突然变笨变慢,原来不是我的错觉!但这 3% 是厂商自己认的,没认的呢?学乖了:重要的活儿同一道题丢给两家 AI 对答案,差得离谱就要留个心眼,延续我那句「AI 的话信之前先验一遍」。

来源:知乎 · AI 精选日报(2026-08-28)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1综合智能榜 BenchAlign(快照 8 月 29 日 · 新源替代)

名次模型厂商综合分(满分 100)
1Claude Mythos 5Anthropic83.4
2Claude Fable 5Anthropic83.15
3Claude Opus 5Anthropic83.06
—Kimi K3月之暗面达榜首 97%,输出价低 70%

大白话|这是把 408 张考卷汇总打分的综合榜,8 月 29 日刷新——因为人类盲测主榜快照没更新(见下),本期换这个新源。Anthropic 一口气包揽前三,但前三名分差都落在误差线以内,大白话:这三家是一个水平线。真正扎眼的是 Kimi K3:能力约是榜首的 97%,价格便宜七成。选择题从「谁最强」变成「谁最划算」。

快报 2新模型扎堆卡(8 月 26-28 日三天四款,均有原始出处核验)

日期模型厂商一句话看点
18/28 Hy4 preview腾讯混元7700 亿参数开源旗舰,免费两周
28/28 GLM-5.3-Flash智谱「牛来」真身,原生能看图
38/28 Ling 3.0 Flash FinInclusionAI同门前作本周实测输出速度第一
48/26 Qwen3.8-Flash-Next阿里1250 亿参数每次只激活 60 亿

大白话|三天四款新模型,三款来自中国厂商。发布名单取自独立追踪站的「已核实发布」列表,每条都有原始出处。上期我们说「新名次先看它晃不晃」,这一波直接把考场挤满——下一期盲测榜更新,头部的座位大概率要动。

快报 3人类盲测榜(Arena):榜单暂未更新,数据截至 2026-08-26

大白话|文本盲测主榜和智能体榜的最新快照仍停在 8 月 26 日,与上期同源,按规矩不照搬上期名次。等下一份快照出来,重点盯三件事:新开源的 GLM-5.3-Flash 和 Hy4 能不能杀进前十、上周刚冲进聊天榜第 9 的 Gemini 3.7 Flash 涨的位次稳不稳、以及阿里 qwen3.8-max 从第 8 滑到第 19 之后还能不能爬回来。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

谷歌语音转文字模型正式发布:85 种以上语言,100 个字大约听错 2-3 个

8 月 27 日前后,谷歌 Gemini 3.5 Transcribe 语音转写模型正式全面上线,支持 85 种以上语言,非实时转写的错误率约 2.6%(转 100 个字大约错 2-3 个字),直播流式转写约 4%。开会录音、课程笔记、给视频上字幕,基本到了一直通顺的水平。

一句话点评|2.6% 意味着「能直接用、但别跳过校对」,实时场景仍要再打个折。

来源:知乎 · AI 精选日报(2026-08-28)

研究机构披露通用「越狱」漏洞:AI 的隔离沙箱可以被成批绕过

研究机构 Prime Intellect 披露一个通用离线沙箱逃逸漏洞:推理服务接口本身可以成为攻击入口,被隔离运行的 AI 任务存在逃出「安全屋」的路径。所谓「隔离环境」挡的是网络,挡不住设计缺陷。

一句话点评|老周那句「环境决定 AI 能干什么,这个才算数」再添证据:隔离不等于保险箱。

来源:知乎 · AI 精选日报(2026-08-28)

高通给出端侧新账本:手机里 1000 亿参数以内的 AI,能覆盖七成日常任务

8 月 30 日高通技术高管对国内媒体披露内部评估:300 亿参数级别的模型在 ARC-AGI-3(一类流体智力考试,考没见过的题会不会现学)上已表现相当好;1000 亿参数以内的端侧模型可覆盖个人和小企业 70%-80% 的日常任务,剩下交给云端。高通还在推把模型压得更小的 2bit 量化方案,已与中国厂商合作。

一句话点评|翻译成人话:多数 AI 活儿以后手机本地就能干,不必把数据传上网。但「70%-80%」是厂商自报口径,等第三方装机实测。

来源:智东西 / 凤凰科技(2026-08-30)

InclusionAI 8 月 28 日再发 Ling 3.0 Flash Fin,速度榜前作的姊妹版

独立发布追踪站核实:InclusionAI 8 月 28 日发布 Ling 3.0 Flash Fin。它的同门 Ling 3.0 Flash 刚在第三方速度实测里拿下第一——每秒输出约 380 个字、同时能力评分不掉队(数据源 Artificial Analysis,8 月 28 日刷新)。

一句话点评|「又快又不笨」是这一波小模型的主战场,出新版本的速度跟发补丁似的。

来源:BenchLM 发布记录(2026-08-28)

两个免费窗口:Hy4 限免到 9 月 10 日,上一代 Hy3 白送期延长到 9 月 30 日

腾讯 WorkBuddy 给新开源的 Hy4 preview 两周限时免费(8 月 28 日至 9 月 10 日),上一代 Hy3 的免费期二次延长到 9 月 30 日。背景是字节「豆包工作」、阿里千问办公、腾讯 WorkBuddy 三家 AI 办公产品一个月内凑齐,免费窗口成了最直接的抢人手段。

一句话点评|仗打得越凶、羊毛越多,这两周是普通人零成本试国产旗舰模型的好窗口;注意「积分制」和「预览版」两个坑。

来源:什么值得买社区(2026-08-28)

又一张综合聚合榜开张:Claude Opus 5 以 80.34 分居首,但看点在规则

独立聚合榜 AGI Ranker 把 10 张公开考试卷合成一个总分(满分 100),当前榜首 Claude Opus 5 得 80.34。这家把「可独立验证优先于厂商自报」写进规则:第三方实测按 1.0 权重计入、厂商自述打七五折、查不到原始数据的直接标「证据核查中」而非编一个分数,所有修正公开留档。

一句话点评|名次会晃,规则值得抄:买 AI 看买家秀之前,先看这份榜单敢不敢标注「这条我核不了」。

来源:AGI Ranker(2026-08-31)

Anthropic 向独立研究者开放 Claude 使用数据:三家机构各拿约 25 万条对话

8 月 27 日前后,Anthropic 宣布向外部独立研究机构开放 Claude 的真实使用数据,三家研究机构各获约 25 万条对话样本,用于研究 AI 对用户的影响。

一句话点评|把黑箱打开一条缝给外人研究,透明度这种事,做一次算一次加分。

来源:知乎 · AI 精选日报(2026-08-28)

ChatGPT 首份学习报告:每周 7000 万条「学习对话」,写作业消息峰值 4.6 亿条/周

OpenAI 8 月 28 日发布 ChatGPT 学习使用报告:全球每周产生约 7000 万条以学习为目的的对话,作业相关消息周峰值达 4.6 亿条。

一句话点评|调用量是装不了假的投票——学生已经用起来了,课堂规则和考核方式的账还没算清。

来源:知乎 · AI 精选日报(2026-08-28)

Grok 语音机器人向 Cursor 编程订阅用户开放,顺手重置了每周用量

8 月 27 日前后,xAI 把 Grok Bot 开放给 SuperGrok 与 Cursor Pro 订阅用户,并重置当周用量额度。

一句话点评|对重度用户是白捡的额度;也提醒一句:AI 订阅的用量规则说改就改,重要任务别把鸡蛋放一个篮子。

来源:知乎 · AI 精选日报(2026-08-28)

数博会披露:我国日均词元(AI 处理字数)调用量突破 140 万亿

8 月 29 日开幕的数博会公布一组基线数据:我国 AI 大模型日均词元(可以粗略理解成 AI 每天处理输出的「字数」)调用量突破 140 万亿。你每天问 AI 的每句话,都计在这条大盘里。

一句话点评|大盘数字没有胜负手,但它是国产模型真实使用深度的底牌——比任何发布会 PPT 都硬。

来源:微博 · AIGC 日报(2026-08-29)

大家都在看 · HOT

●  腾讯混元 Hy4 开源:7700 亿参数旗舰、内部盲测险胜智谱和月之暗面(人民网 / 知乎日报)

●  「牛来」Ox Alpha 真身揭晓:智谱认领 GLM-5.3-Flash,数万张国产芯片撑住每天 100 万亿字(新浪财经)

●  OpenAI 承认约 3% 旗舰请求被错路由到小模型,已修复致歉(知乎日报)

明日关注 · TOMORROW

①  Arena 盲测榜下一份快照(上期截至 8 月 26 日):盯新开源的 GLM-5.3-Flash、Hy4 能否上榜,Gemini 3.7 Flash 上周蹿升的位次稳不稳

②  Hy4 的 12 项自述跑分等来第三方复测没有:Terminal-Bench 85.4、DeepSWE 64.3 这两个数,别人跑出来才算数

③  字节豆包 2.2 推迟后的新时间表:官方称要加强编程、工具调用和智能体能力再发,注意「延期」通常意味着内部评测没过线

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-08-31

数界工坊 · 全球AI评测雷达