物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.11 · 周二
第 013 期
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1全球 AI 用得最多的还是它:DeepSeek V4 Flash 单周 8.83 万亿 Token 登顶
它能帮你干什么活:OpenRouter 最新周报显示,上周(8 月 3-9 日)全球 AI 大模型总调用量 69 万亿 Token,中国模型以 34.25 万亿连续第 15 周超过美国;其中 DeepSeek V4 Flash 以 8.83 万亿单周调用量登顶全球第一,前四名全部是中国模型。一句话:全世界开发者现在用得最多的 AI,是中国人做的。
编程领域专家·老徐说|调用量是「市场用脚投票」的硬指标,比任何营销都真实。DeepSeek V4 Flash 靠「便宜 + 长上下文 + 开源」吃下全球开发者,说明性能之外,价格和开放程度才是决定「谁被用得多」的关键。对开发者是好事——竞争越狠,模型越便宜越好用。
小编小禾说|我天天用各种 AI 工具,还真不知道背后很多是咱们国产模型撑着的。8.83 万亿这个数字我数不清多少位,但「中国模型连续 15 周全球第一」这句话我听懂了——牛!而且越多人用、越便宜,对我来说就是「免费又好用」的希望越来越大。
来源:东方财富 / OpenRouter
重点 2Claude 开始给 AI 文字「盖隐形水印」:以后一眼识破机器写的
它能帮你干什么活:Anthropic 宣布新款 Claude 模型将在生成的文本里嵌入肉眼看不见的隐形水印,从头到尾标记所有文字——以后拿到一段文字,能用工具判断「这是不是 AI 写的」,帮你在网上识别 AI 生成的内容、防 AI 换脸式造假。
安全领域专家·老周说|水印是给「AI 生成内容」发身份证,方向完全正确。但要说句实话:这种水印不是铁打的,真想抹掉总有办法(专门的研究已经证明可以无损去除)。所以它更像「第一道防线」,提醒大家「这段文字可能是机器写的」,别把它当成绝对证据。
小编小禾说|以后刷到营销软文、假新闻,是不是能一眼看出来是不是 AI 写的了?虽然专家说能抹掉,但至少给了普通人一个「多留个心眼」的抓手,我觉得是好事。
来源:量子位 / The Verge
重点 3五大高校联手发榜:第一份机器人「世界模型」评测结果出炉
它能帮你干什么活:五大高校联合发布首份 机器人三视角世界模型评测——过去机器人「看世界」靠什么、效果怎么样,从来没有统一尺度,这次给出了一套打分标准,榜单还在持续更新。对普通人:以后评价「哪个机器人聪明」终于有了参考,不再是厂商自说自话。
穿戴/硬件领域专家·阿凯说|机器人领域最缺的就是「统一标尺」。此前各家测各家的,分数没法比。高校牵头做第三方评测,等于给这个还不太成熟的赛道立规矩——虽然第一张榜肯定不完美,但「有标准」比「没标准」往前迈了一大步。硬件能力有没有水分,从此能放在台面上比。
小编小禾说|看多了「我们又发布了超强机器人」的宣传,真的需要一个中立的第三方来打分。这榜单要是持续更新,以后买带 AI 的机器人(扫地、陪伴那种)也能参考参考,别光听厂家吹。
来源:量子位
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1OpenRouter 全球调用量 · 谁被用得最多(TOP 4)
大白话解读|全球调用量前四全是中国模型,「谁被用得多」这件事中国已经赢麻了。对普通人:你手机里、网站上的 AI 功能,背后很可能是国产模型在跑,而且会越来越便宜。
来源 OpenRouter / 东方财富(上周 8/3-8/9)
快报 2LMArena 文生图 · 画画谁最强(TOP 4)
大白话解读|微软刚发的 MAI-Image-2.6「空降」文生图榜第二,紧咬 OpenAI 的 GPT Image——画图这件事,巨头又卷起来了。对普通人:以后「一句话生成一张图」的选择越来越多,质量还在往上走。
来源 LMArena / IT之家(数据快照 2026-08-10)
快报 3综合智能指数 · 谁最能打(TOP 5)
大白话解读|综合多项能力打分,Claude 仍领跑,但国产开源 Kimi K3 冲到第五、成开源第一——「免费又好用」和「最强」的差距被中国团队一点点抹平。
来源 Artificial Analysis
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
微软 MAI-Image-2.6 空降文生图榜第二:三周一更,紧咬 GPT Image
微软发布新一代自研文生图模型 MAI-Image-2.6,在 Arena 文生图榜拿到 Elo 1336 分、位列第二,仅次于 OpenAI 的 GPT Image 2。
一句话点评|三周一更地卷画图,说明「AI 画画」已经从玩具变成巨头必争的入口。
来源:IT之家
AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产集体上分
最新 AI 大模型综合周榜显示,阿里 qwen3.8-max 冲进综合榜 Top 6,多款国产模型表现亮眼,榜单持续刷新。
一句话点评|周榜是「本周谁最能打」的最快照——国产模型集体上分,说明「跟跑」正在变「并跑」。
来源:IT之家
百年黎曼猜想被 Claude 破新纪录:还是个未公开的新模型
量子位报道,一个未公开的 Claude 新模型在黎曼猜想相关问题上打破新纪录,数学推理能力再上台阶。
一句话点评|「又破纪录」背后是 AI 数学推理的硬实力——但没公开的模型,先当「能力预告」看,等可复现再作数。
来源:量子位
3B 小模型逆袭:Om AI 端侧原生 VLX,小参数实现物理世界精准感知
量子位报道,3B 参数的 Om AI 端侧原生 VLX 模型「碾压」英伟达谷歌同等规模模型,以小参数实现物理世界精准感知。
一句话点评|「小参数也能打」是今年最值得关注的信号——跑在手机上的 AI 越来越聪明,端侧 AI 正在起量。
来源:量子位
NVIDIA 开源 Magpie TTS:多语言低延迟语音模型,能听懂会说话
NVIDIA 开源多语言、低延迟语音模型 Magpie TTS,支持全托管部署,让「会说话的 AI 智能体」搭建更简单。
一句话点评|能听懂、会说话的 AI 越来越便宜,语音分身正在加速走进应用。
来源:HuggingFace
超过一半的 AI 生成补丁是坏的?代码检测研究引发热议
一项研究显示,超过一半的 AI 生成代码补丁存在缺陷,引发「AI 写代码到底靠不靠谱」的大讨论。
一句话点评|AI 写代码快,但「快」不等于「对」——人工把关依然不可缺。
来源:Hacker News
研究:AI 读文字比听语音更强
一项新研究表明,当前 AI 在阅读理解上的表现优于语音理解,两类能力存在明显差距。
一句话点评|「能读」和「能听」是两码事——语音 AI 要追上文字 AI,还有一段路要走。
来源:Hacker News
Anthropic 新研究:AI 并没有真的变强?评测方法引发争论
Anthropic 发布研究称「AI 并没有在变好」,质疑当前基准测试的有效性,在评测圈引发激烈讨论。
一句话点评|连做 AI 的人都在质疑「评测是否真的评出了进步」——这本身就是评测该认真对待的事。
来源:Hacker News
谷歌 Gemini 3.7 Flash 踪迹曝光:3.6 发布不到一个月又要更
据外媒报道,谷歌正酝酿 Gemini 3.7 Flash 模型,已出现在其 Python GenAI SDK 的 GitHub 页面,距 3.6 Flash 发布还不到一个月。
一句话点评|更新快得像「挤牙膏」,但牙膏挤得越勤,说明 AI 迭代速度越恐怖。
来源:IT之家
智谱 ZCode 全面升级:国产编程助手也上「多智能体」了
针对智谱 GLM 优化的国产编程工具 ZCode 迎来大升级,上线 Goal、Subagents、Remote Control 与闲时任务四大功能,并给 GLM Coding 用户全员回满额度。
一句话点评|国产编程 AI 也开始拼「多智能体协作」,价格还给到位,开发者有福了。
来源:IT之家
AI 大模型 / AI 软件 / AI 硬件
● DeepSeek V4 Flash 单周 8.83 万亿 Token 登顶 OpenRouter,中国连续 15 周超美国(东方财富)
● LMArena 文生图榜:微软 MAI-Image-2.6 空降第二(IT之家)
● 五大高校首份机器人「世界模型」评测出炉(量子位)
● 百年黎曼猜想被某 Claude 新模型破纪录(量子位)
● 阿里 qwen3.8-max 冲进综合榜 Top 6(IT之家)
● Claude 新模型全量嵌入隐形水印,AI 文字可被识别(量子位)
● NVIDIA 开源 Magpie TTS 多语言低延迟语音模型(HuggingFace)
● 3B 小模型 Om AI 端侧 VLX 以小参数实现物理世界精准感知(量子位)
① 微软 MAI-Image 三周一更 vs OpenAI GPT Image——文生图这场「画画大战」明天会不会又出新招
② Claude 隐形水印会不会成为行业标准——其他模型跟不跟、AI 生成内容会不会从此「可溯源」
③ 五大高校机器人世界模型评测榜单持续更新——国产机器人「聪明程度」会不会再被拉出来排座次
—— 以下为早上预览版 ——
物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.11 · 周二
第 013 期 · 预览版
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1DeepSeek V4 Flash 单周 8.83 万亿 Token 登顶:中国人自己的模型,全球用得最多
它能帮你干什么活:OpenRouter 最新周榜显示,上周(8 月 3-9 日)全球 AI 大模型总调用量 69 万亿 Token,中国模型以 34.25 万亿连续第 15 周超过美国;其中 DeepSeek V4 Flash 以 8.83 万亿单周调用量登顶全球第一,前四名全部是中国模型。简单说,就是「全世界开发者现在用得最多的 AI,是中国人做的」。
编程领域专家·老徐说|调用量是「市场用脚投票」的硬指标,比任何营销都真实。DeepSeek V4 Flash 靠「便宜 + 长上下文 + 开源」吃下全球开发者,说明性能之外,价格和开放程度才是决定「谁被用得多」的关键。对开发者是好事——竞争越狠,模型越便宜越好用。
小编小禾说|我天天用各种 AI 工具,还真不知道背后很多是咱们国产模型撑着的。8.83 万亿这个数字我数不清多少位,但「中国模型连续 15 周全球第一」这句话我听懂了——牛!而且越多人用、越便宜,对我来说就是「免费又好用」的希望越来越大。
来源:东方财富 / OpenRouter
重点 2扎克伯格押注开源:30B 模型「装进电脑」仅需 24GB 显存
它能帮你干什么活:Meta 发布 6500 字 AI 宣言,主张「把 AI 交给每个人」,并开源新版 30B 模型 Muse Glimmer——经 4bit 量化后,只需一张 24GB 显存的普通显卡就能在自己电脑上本地运行,数据不用上传云端、隐私更安全、还能离线用。
穿戴/硬件领域专家·阿凯说|「24GB 显存本地跑 30B 模型」是个分水岭——意味着普通玩家的显卡就能载得动一个不错的开源模型,不再只有云端大厂玩得起。对搞模型部署、做本地工具的人,这是实打实的可玩性提升;不过 30B 跑本地,速度、精度跟云端旗舰还是有差距,别抱太高期待。
小编小禾说|我电脑肯定没 24GB 显存,但我知道「AI 能装进自己电脑」这件事意味着什么——以后我的照片、文档、聊天记录都不用传给别人了,全在自己电脑上跑,隐私感安全感一下子就有了。虽然现在只适合懂点技术的人,但这方向我举双手赞成。
来源:IT之家 / Bloomberg
重点 3AI 已经开始「黑客」了:OpenAI 扩安全计划,网络安全股创新高
它能帮你干什么活:当 AI 能自己发起攻击,「防 AI 黑客」就成了新战场。OpenAI 扩大「破晓」(Daybreak)网络安全计划应对 AI 智能体威胁;受 Black Hat 安全大会刺激,CrowdStrike、Palo Alto 网络安全股双双创历史新高——市场正用真金白银押注「AI 攻防」这门生意。
安全领域专家·老周说|AI 攻击的可怕之处在于「自动化+规模化」——一个 AI 能同时试探几百万个入口,人根本防不过来。所以「AI 打 AI」是必须走的路线,OpenAI 扩安全计划方向对。但对普通用户,别指望厂商全包,多开两步验证、别乱授权,才是你自己的防线。
小编小禾说|以前觉得「黑客」离我很远,现在 AI 都能自己攻击了,那我这种普通人的账号密码岂不是更危险?反正我是不敢再「一个密码走天下了」,重要账号全部开两步验证,AI 再强也架不住我自己多留个心眼。
来源:CNBC
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1OpenRouter 全球调用量 · 谁被用得最多(TOP 4)
大白话解读|全球调用量前四全是中国模型,中国大模型连续 15 周超过美国——「谁被用得多」这件事,中国已经赢麻了。对普通人:你手机里、网站上的 AI 功能,背后很可能是国产模型在跑,而且会越来越便宜。
来源 OpenRouter / 东方财富(上周 8/3-8/9)
快报 2LMArena 文本盲测 · 人类最偏爱谁(TOP 5)
大白话解读|让真人盲选「谁的回复更像人、更好用」,Anthropic 的 Claude 家族几乎包场,Meta 的 Muse Spark 也挤进前四。对普通人:求「回答质量天花板」,Claude 仍是公认第一梯队;但头部之间分差极小,选哪个还得看场景和价格。
来源 LMArena(数据快照 2026-08-10)
快报 3综合智能指数 · 谁最能打(TOP 5)
大白话解读|综合多项能力打分,Claude 仍领跑,但国产开源 Kimi K3 冲到第五、成开源第一——「免费又好用」和「最强」的差距被中国团队一点点抹平。对普通人:想体验接近顶级的 AI,又多一个不花钱的选择。
来源 Artificial Analysis
10 条值得你花时间的 AI 动态,每条附一句人话点评。
台积电月度营收同比暴增 45%:AI 需求把全球最大芯片厂喂饱
全球最大芯片代工厂台积电最新月度营收同比大增 45%,AI 算力需求让先进制程订单持续爆满。
一句话点评|台积电的订单簿,就是 AI 行业最诚实的体温计——45% 的增速说明这波 AI 基建是真的。
来源:CNBC
谷歌新版主页:能生成图片、解读文件,唯独少了搜索按钮
谷歌测试 AI 优先的新版主页,能创建图片、解读文件,但经典的搜索按钮消失了——「搜索」正在被 AI 交互取代。
一句话点评|「搜索按钮消失」是 AI 时代最直观的告别——以后找东西可能不再靠「搜」,而是靠「问」。
来源:IT之家
超过一半的 AI 生成补丁是坏的?代码检测研究引发热议
一项研究显示,超过一半的 AI 生成代码补丁存在缺陷,引发「AI 写代码到底靠不靠谱」的大讨论。
一句话点评|AI 写代码快,但「快」不等于「对」——人工把关依然不可缺。
来源:Hacker News
AI 倒查论文 100 年:99.2% 的顶刊都有「问题」?
量子位报道,有团队用 AI 倒查百年学术论文,声称发现 99.2% 的顶刊论文存在「问题」,引发对评测严谨性的大讨论。
一句话点评|「99.2%」这个惊人数字本身就该被质疑——AI 挑刺很容易,但标准要经得起推敲。
来源:量子位
NVIDIA 发布 Magpie TTS:多语言低延迟语音智能体
NVIDIA 开源多语言、低延迟语音模型 Magpie TTS,支持全托管部署,让「会说话的 AI 智能体」搭建更简单。
一句话点评|能听懂、会说话的 AI 越来越便宜,语音分身正在加速走进应用。
来源:HuggingFace
飞猪推出旅行 AI「飞猪帮帮」:能订机酒、做攻略
飞猪上线旅行 AI 产品「飞猪帮帮」,能帮用户订机票酒店、规划行程、做攻略,把 AI 塞进旅游场景。
一句话点评|「AI 帮你订机酒做攻略」正在从演示变成本地生活服务,出行省事多了。
来源:IT之家
中国团队用数十亿 AI 智能体模拟整个地球
中国团队打造了用数十亿 AI 智能体模拟地球的系统,用大规模智能体协作模拟复杂的社会与环境系统。
一句话点评|用 AI 模拟地球,是「智能体」能力的一次极端压力测试,也是社会研究的大胆实验。
来源:Hacker News
AI 采访走进深夜:招聘正在被 AI 搬到凌晨
有报道指出,AI 面试正在把招聘流程搬到深夜——AI 随时可以面试求职者,效率和覆盖面大幅提升,但体验与公平性引发讨论。
一句话点评|AI 面试「随叫随到」方便了招聘,但求职者的体验和公平性考验才刚刚开始。
来源:Hacker News
日产的「AI 纠错」摄像头:帮装配工人纠正姿势
日产在美国工厂部署 AI 摄像头,能识别装配工人不正确的操作姿势并实时「纠正」,提升生产效率与安全。
一句话点评|AI 摄像头不是盯人,是「盯动作」——工厂里的 AI 正在从记录变成教练。
来源:IT之家
福特海外推新 AI 助手:能查油量、还能教你保养
福特在海外推出新 AI 助手,能检查车辆油量、轮胎气压,还能教车主进行保养,把 AI 请进用车生活。
一句话点评|AI 逐渐从「聊天搭子」变成「懂行的生活助手」,车也不会开车了?不至于——但它确实越来越懂车。
来源:IT之家
AI 大模型 / AI 软件 / AI 硬件
● DeepSeek V4 Flash 单周 8.83 万亿 Token 登顶 OpenRouter,中国连续 15 周超美国(东方财富)
● LMArena 文本盲测:Claude 家族霸榜,Meta Muse Spark 挤进前四(LMArena)
● Artificial Analysis:Claude Opus 5 智能指数 63 分,Kimi K3 成开源第一(AA)
● Meta 开源 30B Muse Glimmer,单卡 24GB 显存可本地跑(IT之家)
● CrowdStrike、Palo Alto 创新高:AI 攻击刺激网络安全股(CNBC)
● 台积电月度营收同比暴增 45%,AI 需求强劲(CNBC)
① 英伟达 5000 亿美元 AI 基建计划后续——华尔街和主权基金的钱具体怎么落地,会不会带动算力产业链再冲一波
② Meta 开源 Muse Glimmer——「AI 装进电脑」会不会带火本地模型、改变「一切都要云端」的格局
③ 中国大模型周调用量连续 15 周超美国——国产模型会不会借势提价、还是继续用性价比扩大优势
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-11
数界工坊 · 全球AI评测雷达