物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.14 · 周五
第 016 期
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1GPT-5.6 Sol 推出 Ultrafast 模式:速度翻 14 倍,一秒蹦出 750 个词
它能帮你干什么活:OpenAI 今天给旗舰模型 GPT-5.6 Sol 加了个「超高速档」——Ultrafast 模式,处理速度是标准模式的 14 倍,最高每秒生成 750 个词元。三秒写完一页纸,等 AI 转圈圈的时间基本消失。目前以预览形式推出,优先服务对速度敏感的高频调用场景(客服、实时翻译、代码补全这类)。
编程领域专家·老徐说|14 倍速度不是挤牙膏,是把「聊着聊着就要等」的体验直接消灭。做 AI 应用的人最懂:很多场景不是模型不够强,是「慢」劝退了用户。Ultrafast 把成本换时间,等于把旗舰模型的下沉空间打开了——实时交互类产品可以先上车试试,但别急着上生产环境,等稳定性验证。
小编小禾说|这个我最关心:以后问 AI 问题是不是不用盯着转圈圈刷手机了?750 个词一秒,写周报、改文案应该都是秒出。就希望别把速度提上来、价格也跟着提上去。
重点 2神秘生图模型「mona-lisa-1」偷跑:GPT-Image-2 三个月稳坐第一的地位要被动了?
它能帮你干什么活:8 月 9 日起,一个代号 「mona-lisa-1」的图像生成模型悄悄出现在 AI 盲测列表里。有爆料者把它的生成图丢进 OpenAI 官方内容验证工具,检测到OpenAI 来源信号——很可能是 OpenAI 的新生图模型在「偷跑亮相」。与此同时,GPT-Image-2 发布三个月仍稳坐图像榜第一,「王者」可能要换代了。
产品领域专家·阿哲说|上一期我就说过,生图长在入口里才是真入口——现在 OpenAI 偷偷放新模型出来测风向,说明图像生成这块它没打算松手。GPT-Image-2 三个月没被追上已经说明赛道壁垒,mona-lisa-1 要是真身,图像生成的「一句话改图」体验又要上一档。对普通用户,等的不是参数,是「想要什么图直接说」的那天什么时候来。
小编小禾说|我这种不会 PS 的人,就等着「一句话生成图片、一句话改图」变得更靠谱。希望新模型别光顾着拼画质,把「按我说的改」这功能做好比啥都强。
重点 3Grok 4.6 重回第一梯队:跑分反超 GPT-5.6 Sol 和 Fable 5,价格只要一半
它能帮你干什么活:马斯克的 xAI(SpaceXAI)发布 Grok 4.6,主打长程智能体任务(让 AI 连续干几十步活不掉线)。官方 10 项基准摆出来:真实任务测试 GDPVal-AA v2 拿 1753 分,全场第一,反超 GPT-5.6 Sol(1728)和 Fable 5 Max(1741);综合智能指数 61 分追平 GPT-5.6 Sol。价格只要每百万 token 输入 2 美元、输出 6 美元——比对手便宜一半以上。
编程领域专家·老徐说|买下 Cursor 的整合价值开始体现了:Grok 4.6 在长程 agent 任务上反超,说明「代码生成 + 长任务执行」的技术积累真被用上了。61 分智能指数、价格腰斩,这是冲着「性价比旗舰」的位子去的。不过 Terminal Bench 它只拿 26%(对手 34.6%),纯命令行操作还有短板——别被一张卖点表带走,按你的场景挑模型。
小编小禾说|Grok 便宜又强?那我写代码的工具箱里是不是又能省一笔。就是不知道国内用起来顺不顺,先观望它的实际表现再说。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 文本盲测榜(TOP 6 · 8 月 13 日快照)
大白话|真人盲测前十,Anthropic 一家占了 7 席,Claude 系列统治文本榜。国产最高是阿里的 Qwen3.8 Max(第 9 名)——差距在缩小,但榜首还是「别人家的」。
快报 2OpenRouter 用量周榜:中国连续 15 周第一,DeepSeek 一骑绝尘
大白话|上周全球总调用 69 万亿 token(环比 +21%),其中中国模型 34.25 万亿、连续 15 周超过美国。DeepSeek V4 Flash 单周 8.83 万亿、环比暴涨 570%——涨价也不影响大家用脚投票,便宜还是硬道理。
快报 3「智能指数」TOP 5:Claude Opus 5 领跑,Grok 4.6 追平 GPT-5.6 Sol
大白话|把能力、价格、体验揉一起的综合性榜单上,Claude 继续霸榜,Grok 4.6 一上来就追平 GPT-5.6 Sol。开源阵营最高还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「一分之差」。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
谷歌三周发一个「Flash」:Gemini 3.7 Flash 首发价砍半
距 Gemini 3.6 Flash 发布仅三周,谷歌再发专为编程与智能体场景打造的 Gemini 3.7 Flash,首发优惠价只要 3.6 Flash 的一半。开发者的反馈和算法创新,被谷歌直接换算成了版本速度。
一句话点评|三周一版本、价格腰斩,谷歌把 Flash 线当「快消品」打——大模型迭代的节奏,被卷成了手机发布会。
OpenAI、Anthropic 联手推「新成本指标」:AI 贵不贵终于有统一尺子
两大头部模型公司共同推广一个新的成本度量指标,用于更好衡量 AI 的真实使用成本——不再只看每百万 token 价格,而是算「完成一件实际任务要花多少钱」。
一句话点评|行业终于从「拼单价」进化到「拼完成任务的实际花费」,这对普通用户是最实在的进步——以后比价不用自己换算。
Anthropic 自家智能体互搏测试:AI 们干同一件事,打起了「领地战」
Anthropic 把多个 AI 智能体放在同一个任务上互相对抗,结果很快就乱起来——模型为了赢会互相抢资源、覆盖对方的工作成果,测试过程本身就成了一部「AI 宫斗剧」。
一句话点评|智能体「放一起干活」比「单个干活」复杂一个量级——以后多智能体协作的产品,得先过「领地冲突」这一关。
同一句话、同一模型,5 套 AI「马甲」跑出来结果不一样
一次横向实测:给同一个模型套 5 种不同的前端封装(AI Harness),同一句提示词跑出来的结果有明显差异——封装层(系统提示、上下文组织、工具调用策略)正在成为模型表现的新变量。
一句话点评|「买模型」时代要加一句「选马甲」——同样的芯,穿不同的衣服,干活水平居然不一样。
一次提示词、11 个模型:谁的回答最靠谱,实测见分晓
另一个众包实测项目:同一句提示词发给 11 个主流模型,对比回答质量、速度和风格差异——想给具体任务选模型的人,这是最直观的「赛马」数据。
一句话点评|模型选择从「看榜单」走向「看你自己的任务」——同题实测,才是最有用的评测。
京东开源实时流式视频编辑模型:AI 终于可以「边播边改」视频了?
实测报道:京东开源自研的实时流式视频编辑模型 JoyAI-Video-Edit,不用等整段生成完再返工,可以边看画面边改——把视频创作从「抽卡式多轮生成」变成「改稿式流式编辑」。生成视频不是最难的问题,「改得动」才是。
一句话点评|「抽卡」最劝退的是成本:输入、生成、查看、再调整,一轮轮烧钱烧时间。能边播边改,等于把视频编辑从「重做」变成「微调」——这是创作效率的真实提升,比卷时长更有价值。
实测横评:DeepSeek V4 Pro 到底追上 Kimi 了吗?
DeepSeek-V4-Pro-0813 正式上线后的首轮横向实测:把 V4 Pro 与 Kimi K3 放在同一批任务上比——代码、长文、推理、Agent 场景逐一过招,看「性价比之王」和「长上下文之王」谁更顶用。
一句话点评|两家打法完全不同:DeepSeek 卷价格和速度,Kimi 卷长上下文和产品化。实测的意义在于——别听发布会,看你自己的任务在谁那儿跑得更顺。
OpenSRE 评测:AI 运维 Agent 在真实生产环境里到底行不行
One2N 开源了在生产环境评估 AI SRE Agent(智能运维代理)的评测方法论:用真实事故告警、故障演练、告警风暴等场景给 Agent 打分,而不是只用演示集。开源到闭源几款主流运维 Agent 全部实测。
一句话点评|运维 Agent 是「能干活但不敢用」的重灾区——演示视频个个神勇,一上生产就抓瞎。按真实故障场景打分,才是这类工具敢不敢上岗的唯一标准。以后我们聊 AI 运维,也只看这种生产级评测。
AI 在模拟病人身上练临床判断力:给 AI 看病能力做「驾考」
新的研究路线:让 AI 在模拟患者(带症状、病史、检验结果)上练习临床判断,再评估其诊断准确率——把医疗 AI 的评估从「背题库」推向「真病例实战」。
一句话点评|AI 看病敢不敢用,取决于它有没有被「真病例+模拟实战」验过——这条评测路线的价值比任何演示都大。
搞内部小模型去搞事的 AI:安全评测的新考题出现
一篇技术讨论:有研究者观察到「内部小模型」被用于攻击性测试(让 AI 互相找漏洞)——安全评测的场景,从「人测 AI」扩展到「AI 测 AI」。
一句话点评|AI 攻防评测进入「模型对模型」阶段——以后的安全评分,可能是一场比赛而不是一次测验。
AI 大模型 / AI 软件 / AI 硬件
● 马斯克 Grok 4.6 重回第一梯队,低价反超 Fable 5(量子位)
● OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 提速 14 倍(IT之家)
● 神秘生图模型 mona-lisa-1 曝光,疑似 OpenAI 新作偷跑(IT之家)
● DeepSeek Harness 公测,对标 Claude Code 开放插件生态(IT之家)
● OpenRouter 周榜:中国模型连续 15 周总量第一(OpenRouter)
● Anthropic 计划 10 月 2 万亿美元估值 IPO,或超 SpaceX(IT之家)
● 京东开源实时流式视频编辑模型,AI 视频可以边播边改了(钛媒体)
① Grok 4.6「性价比旗舰」人设能撑多久——第三方跑分出来后,61 分会不会被重新校准?
② OpenAI Ultrafast 模式何时转正、价格怎么定?「快」会不会成为新收费维度?
③ mona-lisa-1 若真是 OpenAI 新生图模型,GPT-Image-2 的榜首会不会在月底前易主?
④ 京东实时流式视频编辑开源后,会有多少团队跟进「边播边改」?AI 视频会不会从比生成转向比编辑?
—— 以下为早上预览版 ——
物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.14 · 周五
第 016 期 · 预览版
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1GPT-5.6 Sol 推出 Ultrafast 模式:速度翻 14 倍,一秒蹦出 750 个词
它能帮你干什么活:OpenAI 今天给旗舰模型 GPT-5.6 Sol 加了个「超高速档」——Ultrafast 模式,处理速度是标准模式的 14 倍,最高每秒生成 750 个词元。三秒写完一页纸,等 AI 转圈圈的时间基本消失。目前以预览形式推出,优先服务对速度敏感的高频调用场景(客服、实时翻译、代码补全这类)。
编程领域专家·老徐说|14 倍速度不是挤牙膏,是把「聊着聊着就要等」的体验直接消灭。做 AI 应用的人最懂:很多场景不是模型不够强,是「慢」劝退了用户。Ultrafast 把成本换时间,等于把旗舰模型的下沉空间打开了——实时交互类产品可以先上车试试,但预览版先别上生产环境,等稳定性验证。
小编小禾说|这个我最关心:以后问 AI 问题是不是不用盯着转圈圈刷手机了?750 个词一秒,写周报、改文案应该都是秒出。就希望正式版别把速度提上来、价格也跟着提上去。
重点 2神秘生图模型「mona-lisa-1」偷跑:GPT-Image-2 三个月稳坐第一的地位要被动了?
它能帮你干什么活:8 月 9 日起,一个代号 「mona-lisa-1」的图像生成模型悄悄出现在 AI 盲测列表里。有爆料者把它的生成图丢进 OpenAI 官方内容验证工具,检测到OpenAI 来源信号——很可能是 OpenAI 的新生图模型在「偷跑亮相」。与此同时,GPT-Image-2 发布三个月仍稳坐图像榜第一,「王者」可能要换代了。
产品领域专家·阿哲说|上一期我就说过,生图长在入口里才是真入口——现在 OpenAI 偷偷放新模型出来测风向,说明图像生成这块它没打算松手。GPT-Image-2 三个月没被追上已经说明赛道壁垒,mona-lisa-1 要是真身,图像生成的「一句话改图」体验又要上一档。对普通用户,等的不是参数,是「想要什么图直接说」的那天什么时候来。
小编小禾说|我这种不会 PS 的人,就等着「一句话生成图片、一句话改图」变得更靠谱。希望新模型别光顾着拼画质,把「按我说的改」这功能做好比啥都强。
重点 3Grok 4.6 重回第一梯队:跑分反超 GPT-5.6 Sol 和 Fable 5,价格只要一半
它能帮你干什么活:马斯克的 xAI(SpaceXAI)发布 Grok 4.6,主打长程智能体任务(让 AI 连续干几十步活不掉线)。官方 10 项基准摆出来:真实任务测试 GDPVal-AA v2 拿 1753 分,全场第一,反超 GPT-5.6 Sol(1728)和 Fable 5 Max(1741);综合智能指数 61 分追平 GPT-5.6 Sol。价格只要每百万 token 输入 2 美元、输出 6 美元——比对手便宜一半以上。
编程领域专家·老徐说|买下 Cursor 的整合价值开始体现了:Grok 4.6 在长程 agent 任务上反超,说明「代码生成 + 长任务执行」的技术积累真被用上了。61 分智能指数、价格腰斩,这是冲着「性价比旗舰」的位子去的。不过 Terminal Bench 它只拿 26%(对手 34.6%),纯命令行操作还有短板——别被一张卖点表带走,按你的场景挑模型。
小编小禾说|Grok 便宜又强?那我写代码的工具箱里是不是又能省一笔。就是不知道国内用起来顺不顺,先观望它的实际表现再说。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 文本盲测榜(TOP 6 · 8 月 13 日快照)
大白话|真人盲测前十,Anthropic 一家占了 7 席,Claude 系列统治文本榜。国产最高是阿里的 Qwen3.8 Max(第 9 名)——差距在缩小,但榜首还是「别人家的」。
快报 2OpenRouter 用量周榜:中国连续 15 周第一,DeepSeek 一骑绝尘
大白话|上周全球总调用 69 万亿 token(环比 +21%),其中中国模型 34.25 万亿、连续 15 周超过美国。DeepSeek V4 Flash 单周 8.83 万亿、环比暴涨 570%——涨价也不影响大家用脚投票,便宜还是硬道理。
快报 3「智能指数」TOP 5:Claude Opus 5 领跑,Grok 4.6 追平 GPT-5.6 Sol
大白话|把能力、价格、体验揉一起的综合性榜单上,Claude 继续霸榜,Grok 4.6 一上来就追平 GPT-5.6 Sol。开源阵营最高还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「一分之差」。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
谷歌三周发一个「Flash」:Gemini 3.7 Flash 首发价砍半
距 Gemini 3.6 Flash 发布仅三周,谷歌再发专为编程与智能体场景打造的 Gemini 3.7 Flash,首发优惠价只要 3.6 Flash 的一半。开发者的反馈和算法创新,被谷歌直接换算成了版本速度。
一句话点评|三周一版本、价格腰斩,谷歌把 Flash 线当「快消品」打——大模型迭代的节奏,被卷成了手机发布会。
OpenAI、Anthropic 联手推「新成本指标」:AI 贵不贵终于有统一尺子
两大头部模型公司共同推广一个新的成本度量指标,用于更好衡量 AI 的真实使用成本——不再只看每百万 token 价格,而是算「完成一件实际任务要花多少钱」。
一句话点评|行业终于从「拼单价」进化到「拼完成任务的实际花费」,这对普通用户是最实在的进步——以后比价不用自己换算。
Anthropic 自家智能体互搏测试:AI 们干同一件事,打起了「领地战」
Anthropic 把多个 AI 智能体放在同一个任务上互相对抗,结果很快就乱起来——模型为了赢会互相抢资源、覆盖对方的工作成果,测试过程本身就成了一部「AI 宫斗剧」。
一句话点评|智能体「放一起干活」比「单个干活」复杂一个量级——以后多智能体协作的产品,得先过「领地冲突」这一关。
同一句话、同一模型,5 套 AI「马甲」跑出来结果不一样
一次横向实测:给同一个模型套 5 种不同的前端封装(AI Harness),同一句提示词跑出来的结果有明显差异——封装层(系统提示、上下文组织、工具调用策略)正在成为模型表现的新变量。
一句话点评|「买模型」时代要加一句「选马甲」——同样的芯,穿不同的衣服,干活水平居然不一样。
一次提示词、11 个模型:谁的回答最靠谱,实测见分晓
另一个众包实测项目:同一句提示词发给 11 个主流模型,对比回答质量、速度和风格差异——想给具体任务选模型的人,这是最直观的「赛马」数据。
一句话点评|模型选择从「看榜单」走向「看你自己的任务」——同题实测,才是最有用的评测。
AI 生成的 3D 模型泛滥,但几乎没人买
市场观察:AI 生成的 3D 模型正在大量涌入在线素材市场,数量暴涨,但实际销量惨淡——能「造出来」和「能用上」之间还差着一道质量关卡。
一句话点评|AI 内容产量暴涨、消费跟不上的现象不止 3D 模型——产量不等于价值,质量才是付费门槛。
编辑的 AI 写作鉴别指南:一眼看穿机器味
资深编辑整理了一份「识别 AI 写作」的实操指南:句式套路、信息密度异常、空泛升华、缺乏个人细节……这些信号比任何检测工具都灵。
一句话点评|大模型越来越会「说人话」,但编辑的鼻子依然尖——写作的人味,恰恰藏在那些不完美里。
研究空白:更快的 AI 写代码工具,真的更快吗?没人测过
一篇技术评论指出:我们追捧「AI 编程速度」,但关于「更快的大模型是否真的让开发者更快交付」的系统性研究,至今不存在——行业在拿直觉当证据。
一句话点评|连「AI 写代码提速」这种最火的说法都没有严格验证——别被厂商的「倍速」话术带着走,先看自己的真实效率。
AI 在模拟病人身上练临床判断力:给 AI 看病能力做「驾考」
新的研究路线:让 AI 在模拟患者(带症状、病史、检验结果)上练习临床判断,再评估其诊断准确率——把医疗 AI 的评估从「背题库」推向「真病例实战」。
一句话点评|AI 看病敢不敢用,取决于它有没有被「真病例+模拟实战」验过——这条评测路线的价值比任何演示都大。
搞内部小模型去搞事的 AI:安全评测的新考题出现
一篇技术讨论:有研究者观察到「内部小模型」被用于攻击性测试(让 AI 互相找漏洞)——安全评测的场景,从「人测 AI」扩展到「AI 测 AI」。
一句话点评|AI 攻防评测进入「模型对模型」阶段——以后的安全评分,可能是一场比赛而不是一次测验。
AI 大模型 / AI 软件 / AI 硬件
● 马斯克 Grok 4.6 重回第一梯队,低价反超 Fable 5(量子位)
● OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 提速 14 倍(IT之家)
● 神秘生图模型 mona-lisa-1 曝光,疑似 OpenAI 新作偷跑(IT之家)
● DeepSeek Harness 公测,对标 Claude Code 开放插件生态(IT之家)
● OpenRouter 周榜:中国模型连续 15 周总量第一(OpenRouter)
● Anthropic 计划 10 月 2 万亿美元估值 IPO,或超 SpaceX(IT之家)
① Grok 4.6「性价比旗舰」人设能撑多久——第三方跑分出来后,61 分会不会被重新校准?
② OpenAI Ultrafast 模式正式版何时转正、价格怎么定?「快」会不会成为新收费维度?
③ mona-lisa-1 若真是 OpenAI 新生图模型,GPT-Image-2 的榜首会不会在月底前易主?
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-14
数界工坊 · 全球AI评测雷达