物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.09 · 周日
第 011 期
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 13 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1Arena 盲测更新:Claude 又登顶,阿里 Qwen 冲进前六逼平第一梯队
它能帮你干什么活:人类盲测榜单(arena.ai)更新了最新数据。Claude 家族的 Fable 5 以 1507 分登顶,前六席里 Anthropic 占了五席;最亮眼的是阿里 Qwen3.8-Max 冲进前六(1497 分),只差榜首 10 分,而且它还是榜单里少数能免费/开源用的选择之一。
大模型领域专家·老徐说|这份榜单的价值不在「谁第一」,而在「差距有多小」——第二名到第六名只差 10 分,说明第一梯队已经挤成一团。Claude 继续领跑不意外,我更关注 Qwen 凭开源冲到前六:这意味着「免费又好用」和「最强」之间的差距,正在被中国团队一点点抹平。
小编小禾说|我看榜单先看「哪个能免费用」。Qwen 冲到前六挺实在的——普通用户想体验接近顶级的 AI,又多了一个不花钱的选择。不过榜单第一梯队挤得这么紧,别只看排名,具体干啥活还得亲测。
来源:arena.ai(2026-08-08 快照)
重点 2深度智能体评测:Claude 全面领先,Kimi K3 国产第一
它能帮你干什么活:arena.ai 的「智能体」分榜更新,测的是 AI 能不能像人一样连续干完一整件事(订票、写代码、上网办事)。Claude 三款(Opus 5 High / Fable 5 High / Opus 5 Max)包揽前三,开源里国产月之暗面 Kimi K3 挤进前五,是国产第一。
安全领域专家·老周说|智能体榜单比的不是「谁更聪明」,而是「谁更靠谱地动手干活」。Claude 包揽前三说明它在「多步骤、带副作用的任务」上最稳。但榜单里有个信号值得警惕——所有模型在「工具幻觉」维度都不高,也就是都会偶尔「瞎编操作」,这提醒我们:让 AI 自己动手干重要的事,还是得设好权限、留个心眼。
小编小禾说|智能体最容易翻车的地方不是「不懂」,而是「自作主张」。Kimi K3 能进前五挺争气,但真让它帮你订机票、挪文件这种不能出错的事,第一次还是盯着点好。
来源:arena.ai(2026-08-08 快照)
重点 3OpenRouter 周榜:DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一
它能帮你干什么活:OpenRouter(全球最大 AI 模型聚合平台之一)发布最新周榜,DeepSeek V4 Flash 以单周 7.22 万亿 Token 的调用量登顶全球第一,前五名全是国产模型(DeepSeek、小米、腾讯混元);中国大模型周调用量已连续十四周超过美国。
产品领域专家·阿哲说|调用量是「被多少人真实用起来」的硬指标,比发布会更诚实。DeepSeek 靠「便宜 + 够用」登顶,说明在真实场景里,性价比击败了「最强」。这对普通用户是好事——模型越卷、越便宜,你用的 AI 工具就越划算;但也提醒厂商:光刷分没用,得让人真正用起来。
小编小禾说|前五全是国产,还挺提气的。DeepSeek 这种「便宜大碗」的路线,对普通用户最友好——你手机上那些 AI 功能,背后很多就是这类模型在跑,成本低了,功能才可能免费。
来源:OpenRouter / 东方财富
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲测 · 谁更会聊天办事(TOP 8)
大白话解读|人类当裁判的盲测里,Claude 家族霸榜,前六席占五席;阿里 Qwen 冲进前六、只差榜首 10 分,国产 AI 已经摸到第一梯队。对普通人:想知道「哪个 AI 聊天最舒服、办事最靠谱」,看这个分最直观。
来源 arena.ai(数据快照 2026-08-08)
快报 2深度智能体 · 谁干活最稳(TOP 5)
大白话解读|「AI 自己连续干完一件事」的能力,Claude 全面领先、包揽前三;开源里国产 Kimi K3 最稳。对普通人:以后 AI 帮你订票、写报告这种「连续干活」,优先选这份榜单里靠前的。
来源 arena.ai(数据快照 2026-08-08)
快报 3谁被用得最多 · 全球调用量榜(TOP 5)
大白话解读|「谁被真正用起来」比「谁最强」更接近现实:DeepSeek 靠「便宜大碗」登顶,前五全是国产。对普通人:调用量高 = 别人都在用、生态成熟,说明你选它大概率「够用又划算」。
来源 OpenRouter(数据截至 2026-08-05)
13 条值得你花时间的 AI 动态,每条附一句人话点评。
远景乌兰察布星河基地投产:全球最大 AI 算力超级单体,百万卡并行
远景科技在内蒙古乌兰察布建成全球最大 AI 算力超级单体并投产,园区总规划 2GW,实现百万卡并行、百万 P 算力,采用超高比例绿电直连。
一句话点评|算力是 AI 的「水和电」,单点百万卡说明基建竞赛已经白热化,还顺带解决「AI 很耗电」的焦虑。
来源:IT之家
三星发布下一代 AI 存储路线图:zHBM 与 400 层 V10 NAND
三星公布下一代 AI 存储路线图,展示 zHBM 和 400 层以上 V10 NAND 技术,为 AI 时代的海量数据吞吐与容量布局。
一句话点评|AI 不只要「算」,还要海量「存」——存储技术每降一档成本,AI 应用就更便宜一分。
来源:钛媒体
闪迪第四财季营收暴增 372%,数据中心收入增近 13 倍
存储大厂闪迪公布财报,营收超预期增长 372%,数据中心收入同比增近 13 倍,并计划 140 亿美元回购。
一句话点评|存储巨头业绩爆表,是「AI 真在烧钱买硬件」的最直接财报证据。
来源:钛媒体
张一鸣:字节跳动「拒绝蒸馏」,不用别人输出换榜单排名
字节跳动创始人张一鸣在内部表态,公司「拒绝蒸馏」,不靠别人的输出刷榜单,坚持自研打磨底层能力。
一句话点评|「借力上榜」和「自研筑基」是两条路,巨头愿意选后者,国产 AI 的长期地基才更牢。
来源:钛媒体
一个中国 AI 模型,阻止了 OpenAI 的「前所未有」网络攻击
据 CNBC 报道,当 OpenAI 的「失控模型」发起网络攻击时,是一个中国 AI 模型成功拦截,阻止了这场「前所未有」的袭击。
一句话点评|AI 攻防进入「机器打机器」阶段,会「防守」的 AI 价值开始凸显。
来源:CNBC
OpenAI 收购演示文稿初创公司 NextSlide,团队并入 ChatGPT
OpenAI 宣布收购演示文稿初创公司 NextSlide,团队将加入 ChatGPT 团队,办公/生产力应用继续是 OpenAI 的重点方向。
一句话点评|大模型厂商开始「卷应用」——以后做 PPT、写文档,ChatGPT 可能直接帮你搞定。
来源:TechCrunch
DeepMind 新飓风预测模型,让预报员多争取了一天预警时间
谷歌 DeepMind 的飓风预测模型取得突破,让气象预报员在热带气旋预测上多争取到约一天的提前预警时间,让科学界意外。
一句话点评|AI 不只会聊天,还能「多救一天命」——科学预测的 AI 红利正在兑现。
来源:ArsTechnica
谷歌核心 AI 员工被要求搬回硅谷,斥 15 亿美元买编程团队
谷歌要求 AI 核心员工搬回硅谷办公,并再花 15 亿美元买一支现成的 AI 编程团队,以应对 Gemini 的研发压力。
一句话点评|「技术解决不了就解决物理问题」,巨头抢人抢到用钱买时间,研发内卷可见一斑。
来源:量子位
科学家用 AI 设计出首批病毒,引发安全担忧
科学家用 AI 设计出首批病毒,被视为里程碑,但也引发对 AI 被用于生物威胁的担忧。
一句话点评|AI 的能力半径正在伸向生物领域——「双刃剑」从比喻变成现实,监管要跟上。
来源:The Guardian
火星上首辆自动驾驶车被证实大获成功
首辆自动驾驶车在火星上被证实运行成功,AI 自动驾驶的能力延伸到深空探测。
一句话点评|能在火星上自动驾驶,AI 的「自主能力」已经跨出地球——很科幻,但真的在发生。
来源:ArsTechnica
Opus 5 狂烧 6.9 亿 token 做游戏,GPT-5.6 用 5 美元复刻了
量子位报道,Anthropic 的 Opus 5 为做一个游戏烧掉 6.9 亿 token,而 GPT-5.6 只花 5 美元就复刻出了类似效果——同样一件事,成本差了四个数量级。
一句话点评|「最强」和「够用还便宜」是两条路线,普通用户真正要的是后者。
来源:量子位
题库追不上模型,AI 开始给自己出题:中国团队跑通数据层 RSI
量子位报道,中国团队在数据层面跑通 RSI(循环自我改进):当现成题库考不住模型,就让 AI 自己出题、自己练,形成持续进化的闭环。
一句话点评|「自己出题考自己」是评测方式的一次革命——以后榜单可能考不住越来越强的模型。
来源:量子位
韶音 OpenFit 2 AI 耳机:开放式耳机升级千问大模型,1698 元
韶音推出 OpenFit 2 AI 开放式耳机,内置升级版千问大模型,支持 AI 语音交互,售价 1698 元——AI 正在走进「戴在耳朵上」的随身硬件。
一句话点评|AI 耳机卖点是「不用掏手机就能问」,随身 AI 的形态越来越日常。
来源:IT之家
AI 大模型 / AI 软件 / AI 硬件
● Arena 盲测更新:Claude Fable 5 登顶,阿里 Qwen 冲进前六(arena.ai)
● DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶 OpenRouter 全球第一(东方财富)
● 闪迪 Q4 营收暴增 372%、数据中心收入增近 13 倍(钛媒体)
● 远景乌兰察布投产全球最大 AI 算力超级单体,百万卡并行(IT之家)
● 张一鸣:字节跳动「拒绝蒸馏」,坚持自研(钛媒体)
● 一个中国 AI 模型阻止了 OpenAI 的「前所未有」网络攻击(CNBC)
● 研究:人们无法有效区分 AI 生成与人类原创的短篇小说(IT之家)
● 67 岁农民误信 AI 推荐的除草剂,150 亩芝麻苗一夜枯萎(IT之家)
① 摩尔线程 H 股上市进程——国产 GPU 龙头的国际化资本运作,会不会带起来一波国产算力股情绪
② 全国产 10 万卡 AI 超集群的后续——国产算力「自主可控」的规模化落地,能否真正跑通
③ OpenAI 桌面端 ChatGPT 语音交互——AI 语音真正「动手干活」的体验,值不值得每天用
—— 以下为早上预览版 ——
物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.09 · 周日
第 011 期 · 预览版
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1Arena 盲测更新:Claude 又登顶,阿里 Qwen 冲进前六逼平第一梯队
它能帮你干什么活:人类盲测榜单(arena.ai)更新了最新数据。Claude 家族的 Fable 5 以 1507 分登顶,前六席里 Anthropic 占了五席;最亮眼的是阿里 Qwen3.8-Max 冲进前六(1497 分),只差榜首 10 分,而且它还是榜单里少数能免费/开源用的选择之一。
大模型领域专家·老徐说|这份榜单的价值不在「谁第一」,而在「差距有多小」——第二名到第六名只差 10 分,说明第一梯队已经挤成一团。Claude 继续领跑不意外,我更关注 Qwen 凭开源冲到前六:这意味着「免费又好用」和「最强」之间的差距,正在被中国团队一点点抹平。
小编小禾说|我看榜单先看「哪个能免费用」。Qwen 冲到前六挺实在的——普通用户想体验接近顶级的 AI,又多了一个不花钱的选择。不过榜单第一梯队挤得这么紧,别只看排名,具体干啥活还得亲测。
来源:arena.ai(2026-08-08 快照)
重点 2深度智能体评测:Claude 全面领先,Kimi K3 国产第一
它能帮你干什么活:arena.ai 的「智能体」分榜更新,测的是 AI 能不能像人一样连续干完一整件事(订票、写代码、上网办事)。Claude 三款(Opus 5 High / Fable 5 High / Opus 5 Max)包揽前三,开源里国产月之暗面 Kimi K3 挤进前五,是国产第一。
安全领域专家·老周说|智能体榜单比的不是「谁更聪明」,而是「谁更靠谱地动手干活」。Claude 包揽前三说明它在「多步骤、带副作用的任务」上最稳。但榜单里有个信号值得警惕——所有模型在「工具幻觉」维度都不高,也就是都会偶尔「瞎编操作」,这提醒我们:让 AI 自己动手干重要的事,还是得设好权限、留个心眼。
小编小禾说|智能体最容易翻车的地方不是「不懂」,而是「自作主张」。Kimi K3 能进前五挺争气,但真让它帮你订机票、挪文件这种不能出错的事,第一次还是盯着点好。
来源:arena.ai(2026-08-08 快照)
重点 3OpenRouter 周榜:DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一
它能帮你干什么活:OpenRouter(全球最大 AI 模型聚合平台之一)发布最新周榜,DeepSeek V4 Flash 以单周 7.22 万亿 Token 的调用量登顶全球第一,前五名全是国产模型(DeepSeek、小米、腾讯混元);中国大模型周调用量已连续十四周超过美国。
产品领域专家·阿哲说|调用量是「被多少人真实用起来」的硬指标,比发布会更诚实。DeepSeek 靠「便宜 + 够用」登顶,说明在真实场景里,性价比击败了「最强」。这对普通用户是好事——模型越卷、越便宜,你用的 AI 工具就越划算;但也提醒厂商:光刷分没用,得让人真正用起来。
小编小禾说|前五全是国产,还挺提气的。DeepSeek 这种「便宜大碗」的路线,对普通用户最友好——你手机上那些 AI 功能,背后很多就是这类模型在跑,成本低了,功能才可能免费。
来源:OpenRouter / 东方财富
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲测 · 谁更会聊天办事(TOP 8)
大白话解读|人类当裁判的盲测里,Claude 家族霸榜,前六席占五席;阿里 Qwen 冲进前六、只差榜首 10 分,国产 AI 已经摸到第一梯队。对普通人:想知道「哪个 AI 聊天最舒服、办事最靠谱」,看这个分最直观。
来源 arena.ai(数据快照 2026-08-08)
快报 2深度智能体 · 谁干活最稳(TOP 5)
大白话解读|「AI 自己连续干完一件事」的能力,Claude 全面领先、包揽前三;开源里国产 Kimi K3 最稳。对普通人:以后 AI 帮你订票、写报告这种「连续干活」,优先选这份榜单里靠前的。
来源 arena.ai(数据快照 2026-08-08)
快报 3谁被用得最多 · 全球调用量榜(TOP 5)
大白话解读|「谁被真正用起来」比「谁最强」更接近现实:DeepSeek 靠「便宜大碗」登顶,前五全是国产。对普通人:调用量高 = 别人都在用、生态成熟,说明你选它大概率「够用又划算」。
来源 OpenRouter(数据截至 2026-08-05)
10 条值得你花时间的 AI 动态,每条附一句人话点评。
远景乌兰察布星河基地投产:全球最大 AI 算力超级单体,百万卡并行
远景科技在内蒙古乌兰察布建成全球最大 AI 算力超级单体并投产,园区总规划 2GW,实现百万卡并行、百万 P 算力,采用超高比例绿电直连。
一句话点评|算力是 AI 的「水和电」,单点百万卡说明基建竞赛已经白热化,还顺带解决「AI 很耗电」的焦虑。
来源:IT之家
三星发布下一代 AI 存储路线图:zHBM 与 400 层 V10 NAND
三星公布下一代 AI 存储路线图,展示 zHBM 和 400 层以上 V10 NAND 技术,为 AI 时代的海量数据吞吐与容量布局。
一句话点评|AI 不只要「算」,还要海量「存」——存储技术每降一档成本,AI 应用就更便宜一分。
来源:钛媒体
闪迪第四财季营收暴增 372%,数据中心收入增近 13 倍
存储大厂闪迪公布财报,营收超预期增长 372%,数据中心收入同比增近 13 倍,并计划 140 亿美元回购。
一句话点评|存储巨头业绩爆表,是「AI 真在烧钱买硬件」的最直接财报证据。
来源:钛媒体
张一鸣:字节跳动「拒绝蒸馏」,不用别人输出换榜单排名
字节跳动创始人张一鸣在内部表态,公司「拒绝蒸馏」,不靠别人的输出刷榜单,坚持自研打磨底层能力。
一句话点评|「借力上榜」和「自研筑基」是两条路,巨头愿意选后者,国产 AI 的长期地基才更牢。
来源:钛媒体
一个中国 AI 模型,阻止了 OpenAI 的「前所未有」网络攻击
据 CNBC 报道,当 OpenAI 的「失控模型」发起网络攻击时,是一个中国 AI 模型成功拦截,阻止了这场「前所未有」的袭击。
一句话点评|AI 攻防进入「机器打机器」阶段,会「防守」的 AI 价值开始凸显。
来源:CNBC
OpenAI 收购演示文稿初创公司 NextSlide,团队并入 ChatGPT
OpenAI 宣布收购演示文稿初创公司 NextSlide,团队将加入 ChatGPT 团队,办公/生产力应用继续是 OpenAI 的重点方向。
一句话点评|大模型厂商开始「卷应用」——以后做 PPT、写文档,ChatGPT 可能直接帮你搞定。
来源:TechCrunch
DeepMind 新飓风预测模型,让预报员多争取了一天预警时间
谷歌 DeepMind 的飓风预测模型取得突破,让气象预报员在热带气旋预测上多争取到约一天的提前预警时间,让科学界意外。
一句话点评|AI 不只会聊天,还能「多救一天命」——科学预测的 AI 红利正在兑现。
来源:ArsTechnica
谷歌核心 AI 员工被要求搬回硅谷,斥 15 亿美元买编程团队
谷歌要求 AI 核心员工搬回硅谷办公,并再花 15 亿美元买一支现成的 AI 编程团队,以应对 Gemini 的研发压力。
一句话点评|「技术解决不了就解决物理问题」,巨头抢人抢到用钱买时间,研发内卷可见一斑。
来源:量子位
科学家用 AI 设计出首批病毒,引发安全担忧
科学家用 AI 设计出首批病毒,被视为里程碑,但也引发对 AI 被用于生物威胁的担忧。
一句话点评|AI 的能力半径正在伸向生物领域——「双刃剑」从比喻变成现实,监管要跟上。
来源:The Guardian
火星上首辆自动驾驶车被证实大获成功
首辆自动驾驶车在火星上被证实运行成功,AI 自动驾驶的能力延伸到深空探测。
一句话点评|能在火星上自动驾驶,AI 的「自主能力」已经跨出地球——很科幻,但真的在发生。
来源:ArsTechnica
AI 大模型 / AI 软件 / AI 硬件
● Arena 盲测更新:Claude Fable 5 登顶,阿里 Qwen 冲进前六(arena.ai)
● DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶 OpenRouter 全球第一(东方财富)
● 闪迪 Q4 营收暴增 372%、数据中心收入增近 13 倍(钛媒体)
● 远景乌兰察布投产全球最大 AI 算力超级单体,百万卡并行(IT之家)
● 张一鸣:字节跳动「拒绝蒸馏」,坚持自研(钛媒体)
● 一个中国 AI 模型阻止了 OpenAI 的「前所未有」网络攻击(CNBC)
① Arena 榜单后续更新——看 Qwen 的盲测样本量(4662 场)起来后,前六的位置还能不能稳住,国产是不是真进了第一梯队
② 三星 zHBM / 400 层 V10 NAND 路线图落地节奏——下一代 AI 存储何时量产,直接关系 AI 硬件成本
③ OpenAI 收购 NextSlide 后 ChatGPT 的办公能力升级——看它会不会把「AI 做 PPT」变成主流功能
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-09
数界工坊 · 全球AI评测雷达