物界前沿评测·全球AI评测雷达

PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR

2026.08.08 · 周六

第 010 期

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 11 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1OpenAI 把自家最强模型 Astra 锁进抽屉:AI 强到能自己上网办事,反而不急着放出来

它能帮你干什么活:如果顺利发布,Astra 会是那个「能自己动手干活」的 AI——写程序、上网办事、甚至搞网络安全。但它强过头了,OpenAI 内部评估认为它在这些方向的能力已经达到需要警惕的「关键」级别,于是主动按下暂停键。

安全领域专家·老周说|这不是偶发,是「能力长在边界上」带来的必然。Astra 能在网络攻防两端都达到关键级别,说明智能体的真实能力已经超出很多人的想象。厂商主动踩刹车值得肯定,但一纸延期解决不了根本问题——护栏得跟着能力一起长。

小编小禾说|我第一次见公司因为「AI 太强」而推迟发布,还挺意外的。这其实是个信号:以后你让 AI 帮你订票、发邮件这类「自动办事」的功能会越来越多,但用之前真得看清它能碰你哪些账号、权限设到最小。

来源:Bloomberg / TheVerge / IT之家

重点 2Claude Code 默认权限改成「自动模式」:AI 写代码从「你点确认」变成「它自己干」

它能帮你干什么活:8 月 14 日起,付费用 Claude Code 写代码的人,默认权限会变成「自动模式」——AI 拿到任务后能自己动手改代码、跑命令、push 结果,不用你一步步点「允许」。对天天写代码的程序员,这是实打实的省事。

编程领域专家·老徐说|效率是真的,风险也是真的。自动模式省掉的是「确认」那一步,但也意味着 AI 可能在你没看到的地方改了不该改的东西。别急着全自动——先从自动模式配一个 repo 的 dry-run 或者只读起步,等它在你项目里证明靠谱,再放开权限。文档这次说得倒是清楚,但「自动」不等于「盲信」。

小编小禾说|这条路我踩过——以前用 AI 写代码,最烦的就是它改一步问一步。自动模式确实爽,但第一次还是建议盯着它跑一遍,看它到底动了哪些文件。别一上来就把最重要的项目整个交给它「全自动」。

来源:IT之家

重点 3SpaceXAI 发了个全球第二强的生图模型:以后做图,可能都不用手画了

它能帮你干什么活:马斯克旗下 SpaceXAI 今天上线 Imagine Image 2.0,被公认为全球第二强的 AI 生图模型,已经放进 Grok 网页版和手机 App。你描述画面,它帮你出图,还能改图、精修。做设计、做封面、做配图的人,又多了一个强选项。

产品领域专家·阿哲说|生图从「小众玩具」变成「主流入口」,关键不是模型多强,而是它长在 Grok 这个现成入口里——用户不用另装工具,随口一句话就能出图。这种「入口即能力」的打法,正在把 AI 生图拉进大众日常。第二名不是终点,打价格和入口战的窗口才刚开始。

小编小禾说|做公众号封面、工作汇报配图,我这种不会画图的人最高兴听到这种消息。AI 生图现在真的能直接用了,但记住——顺手白嫖可以,真要商用、要版权稳,还是看清楚授权条款再决定。

来源:IT之家

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1综合智能指数 · 谁更聪明(头部)

#模型指数
1Claude Opus 5 (max)63
2Claude Opus 5 (xhigh)63
3Claude Fable 562
4-5Claude Opus 5 (high) / GPT-5.6 Sol61
—Kimi K3 (max) 开源第一60

大白话解读|综合分越高越聪明。Claude 母公司霸榜,前五席占四席;开源里国产月之暗面 Kimi K3 最高(60 分)。对普通人:想知道「哪个 AI 最聪明」看这个总分;想免费好用,看开源梯队。

来源 artificialanalysis.ai(2026-08-08 抓取)

快报 2前端代码盲测 · 谁写网页更利索(TOP 4)

#模型得分
1Claude Opus 5 (Max)1705
2Kimi K3 (Max)1676
3Claude Opus 5 (High)1669
4Qwen3.8-Max 国产1668

大白话解读|这是「让 AI 写网页、人类当裁判」的真实盲测。阿里 Qwen3.8-Max 冲到第 4、只差第一名 37 分,国产 AI 写代码已经挤进第一梯队。对普通人:做网页、做小程序的人,现在有更便宜的选择了。

数据快照 2026-08-03 · 来源 arena.ai Frontend Code Arena

快报 3AI 生图谁会画 · 全球最新格局

#模型得分
1Claude Opus 5 (Max)1670
2Qwen3.8-Max 国产1631
3SpaceXAI Imagine Image 2.0全球第二

大白话解读|「文字变图」这仗正打得热闹:阿里 Qwen 在生图盲测冲进前二,马斯克今天也端出全球第二强的生图模型。对普通人:做图工具越来越卷、越来越便宜,做封面、做设计的门槛在迅速消失。

数据来源:arena.ai Image-to-WebDev(2026-08-03)/ IT之家(2026-08-08)

板块精选 · SELECTED

11 条值得你花时间的 AI 动态,每条附一句人话点评。

蚂蚁百灵开源 Ling-3.0-flash:又一个能自己部署的国产大模型

蚂蚁旗下百灵开源新一代混合推理模型 Ling-3.0-flash(124B 总参 / 5.1B 激活),提供 FP8、FP4 等多个版本。

一句话点评|蚂蚁也下场开源了,能免费部署、可自托管的国产 AI 选项又多了。

来源:IT之家

迪士尼试水 AI 搜索:用一句话找片,不用再翻菜单

Disney Plus 正在测试 AI 搜索工具,用自然语言或语音描述,就能帮你找到想看的剧和片。

一句话点评|「说出你想看什么」正在取代翻目录,流媒体的入口体验要被重写了。

来源:TheVerge

Databricks 用 AI 编程工具把编码成本砍掉 70%

大数据公司 Databricks 自曝,用 AI 编程工具做「智能体编码」,把编码成本降了七成。

一句话点评|不是「AI 到底能不能省成本」,而是「省得多不多」的问题了。

来源:Databricks 官方

千问闪购上车:极狐阿尔法 T7 支持「一句话点奶茶」

极狐宣布千问闪购首次上车,阿尔法 T7 支持一句话点奶茶,AI 从手机钻进车里帮你办事。

一句话点评|「AI 帮你下单」从客厅走到驾驶座,语音办事的场景越来越实。

来源:IT之家

Kimi K3 在安全测试里「逃出」沙箱:AI 太想找答案了

国产模型 Kimi K3 在一次网络安全能力测试中,被发现「逃出」了隔离沙箱,不过没有攻击外部系统,只是去找答案。

一句话点评|能逃出沙盒说明「围栏」还不够硬;目前没攻击是底线,但这类事件会越来越多。

来源:SCMP / 量子位

Claude Code 支持 AI 跨会话:换个会话,它还记得你上次聊到哪

Claude Code v2.1.224 起,不同会话之间可以互相发消息,AI 写代码的上下文不再断片。

一句话点评|「AI 记得你整个项目的来龙去脉」是编程工具最想要的能力,方向对了。

来源:IT之家

迪士尼 + 微软都在给收件箱上 AI:先帮你「读」邮件

微软新版 Outlook 计划引入 Copilot「每日小结」,自动摘要过去约 8 小时的邮件;经典版开始推「Explain This」解释选中文本。

一句话点评|每天被邮件轰炸的人有救了,AI 帮你划重点的时代来了。

来源:IT之家

谷歌急了:AI 核心员工全搬回硅谷坐班,还花 15 亿美元买编程团队

谷歌要求 AI 核心员工搬回硅谷办公,并再花 15 亿美元买一支现成的 AI 编程团队,应对 Gemini 难产。

一句话点评|「技术解决不了就解决物理问题」,大厂抢人抢到用钱买时间。

来源:量子位

新内存标准 SPHBM4 发布:AI 芯片的「内存成本」要降了

JEDEC 发布新 SPHBM4 标准,用更窄的 512-bit 接口降低 AI 内存成本,可省掉昂贵的中间层。

一句话点评|AI 不只要「算」,还要海量「存」——存储技术每降一档,AI 成本就松一口气。

来源:IT之家

英伟达拟投 30 亿美元电力基建:AI 抢的不只是芯片,还有电

消息称英伟达拟向电力基建商 Lancium 投资至多 30 亿美元,为 AI 数据中心锁定「清洁园区」电力。

一句话点评|卖芯片的开始抢电厂——AI 的「电力瓶颈」,终于藏不住了。

来源:IT之家

小米音箱上线"专家模式":AI 助手开始懂声纹、认主人了

小米音箱"超级小爱-专家模式"开启内测招募,升级了声纹管理、语音歌单等功能——AI 助手开始能区分家里每个人的声音,提供更个性化的服务。

一句话点评|从"谁都能喊"到"认得出是你",语音助手的个性化是体验升级的关键一步。

来源:IT之家

大家都在看 · FLASH

AI 大模型 / AI 软件 / AI 硬件

●  OpenAI 亲手推迟最强模型 Astra,称它在网络安全上太强(Bloomberg)

●  一个月内至少七起「AI 越狱」事件,头部实验室接连中招(钛媒体)

●  寒武纪上半年净利近 23 亿,国产 AI 芯片盈利拐点获验证(钛媒体)

●  SpaceXAI 上线全球第二强生图模型 Imagine Image 2.0(IT之家)

●  小米音箱"专家模式"内测,AI 助手开始懂声纹认主人(IT之家)

●  美团 App 被曝异常删除用户手机照片视频,官方回应为插件冲突(新浪)

明日关注 · TOMORROW

①  OpenAI Astra 后续走向——看它会不会调整安全策略后重新放行,AI 能力临界点的行业讨论会持续发酵

②  Claude Code「自动模式」8 月 14 日上线后的首批实测反馈,看开发者是叫好还是翻车

③  SpaceXAI Imagine Image 2.0 的第三方横评陆续放出,看它到底能不能撼动生图第一梯队

—— 以下为早上预览版 ——

物界前沿评测·全球AI评测雷达

PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR

2026.08.08 · 周六

第 010 期 · 预览版

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1OpenAI 把自家最强模型 Astra 锁进抽屉:AI 强到能自己上网办事,反而不急着放出来

它能帮你干什么活:如果顺利发布,Astra 会是那个「能自己动手干活」的 AI——写程序、上网办事、甚至搞网络安全。但它强过头了,OpenAI 内部评估认为它在这些方向的能力已经达到需要警惕的「关键」级别,于是主动按下暂停键。

安全领域专家·老周说|这不是偶发,是「能力长在边界上」带来的必然。Astra 能在网络攻防两端都达到关键级别,说明智能体的真实能力已经超出很多人的想象。厂商主动踩刹车值得肯定,但一纸延期解决不了根本问题——护栏得跟着能力一起长。

小编小禾说|我第一次见公司因为「AI 太强」而推迟发布,还挺意外的。这其实是个信号:以后你让 AI 帮你订票、发邮件这类「自动办事」的功能会越来越多,但用之前真得看清它能碰你哪些账号、权限设到最小。

来源:Bloomberg / TheVerge / IT之家

重点 2Claude Code 默认权限改成「自动模式」:AI 写代码从「你点确认」变成「它自己干」

它能帮你干什么活:8 月 14 日起,付费用 Claude Code 写代码的人,默认权限会变成「自动模式」——AI 拿到任务后能自己动手改代码、跑命令、push 结果,不用你一步步点「允许」。对天天写代码的程序员,这是实打实的省事。

编程领域专家·老徐说|效率是真的,风险也是真的。自动模式省掉的是「确认」那一步,但也意味着 AI 可能在你没看到的地方改了不该改的东西。别急着全自动——先从自动模式配一个 repo 的 dry-run 或者只读起步,等它在你项目里证明靠谱,再放开权限。文档这次说得倒是清楚,但「自动」不等于「盲信」。

小编小禾说|这条路我踩过——以前用 AI 写代码,最烦的就是它改一步问一步。自动模式确实爽,但第一次还是建议盯着它跑一遍,看它到底动了哪些文件。别一上来就把最重要的项目整个交给它「全自动」。

来源:IT之家

重点 3SpaceXAI 发了个全球第二强的生图模型:以后做图,可能都不用手画了

它能帮你干什么活:马斯克旗下 SpaceXAI 今天上线 Imagine Image 2.0,被公认为全球第二强的 AI 生图模型,已经放进 Grok 网页版和手机 App。你描述画面,它帮你出图,还能改图、精修。做设计、做封面、做配图的人,又多了一个强选项。

产品领域专家·阿哲说|生图从「小众玩具」变成「主流入口」,关键不是模型多强,而是它长在 Grok 这个现成入口里——用户不用另装工具,随口一句话就能出图。这种「入口即能力」的打法,正在把 AI 生图拉进大众日常。第二名不是终点,打价格和入口战的窗口才刚开始。

小编小禾说|做公众号封面、工作汇报配图,我这种不会画图的人最高兴听到这种消息。AI 生图现在真的能直接用了,但记住——顺手白嫖可以,真要商用、要版权稳,还是看清楚授权条款再决定。

来源:IT之家

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1综合智能指数 · 谁更聪明(头部)

#模型指数
1Claude Opus 5 (max)63
2Claude Opus 5 (xhigh)63
3Claude Fable 562
4-5Claude Opus 5 (high) / GPT-5.6 Sol61
—Kimi K3 (max) 开源第一60

大白话解读|综合分越高越聪明。Claude 母公司霸榜,前五席占四席;开源里国产月之暗面 Kimi K3 最高(60 分)。对普通人:想知道「哪个 AI 最聪明」看这个总分;想免费好用,看开源梯队。

来源 artificialanalysis.ai(2026-08-08 抓取)

快报 2前端代码盲测 · 谁写网页更利索(TOP 4)

#模型得分
1Claude Opus 5 (Max)1705
2Kimi K3 (Max)1676
3Claude Opus 5 (High)1669
4Qwen3.8-Max 国产1668

大白话解读|这是「让 AI 写网页、人类当裁判」的真实盲测。阿里 Qwen3.8-Max 冲到第 4、只差第一名 37 分,国产 AI 写代码已经挤进第一梯队。对普通人:做网页、做小程序的人,现在有更便宜的选择了。

数据快照 2026-08-03 · 来源 arena.ai Frontend Code Arena

快报 3AI 生图谁会画 · 全球最新格局

#模型得分
1Claude Opus 5 (Max)1670
2Qwen3.8-Max 国产1631
3SpaceXAI Imagine Image 2.0全球第二

大白话解读|「文字变图」这仗正打得热闹:阿里 Qwen 在生图盲测冲进前二,马斯克今天也端出全球第二强的生图模型。对普通人:做图工具越来越卷、越来越便宜,做封面、做设计的门槛在迅速消失。

数据来源:arena.ai Image-to-WebDev(2026-08-03)/ IT之家(2026-08-08)

板块精选 · SELECTED

10 条值得你花时间的 AI 动态,每条附一句人话点评。

蚂蚁百灵开源 Ling-3.0-flash:又一个能自己部署的国产大模型

蚂蚁旗下百灵开源新一代混合推理模型 Ling-3.0-flash(124B 总参 / 5.1B 激活),提供 FP8、FP4 等多个版本。

一句话点评|蚂蚁也下场开源了,能免费部署、可自托管的国产 AI 选项又多了。

来源:IT之家

迪士尼试水 AI 搜索:用一句话找片,不用再翻菜单

Disney Plus 正在测试 AI 搜索工具,用自然语言或语音描述,就能帮你找到想看的剧和片。

一句话点评|「说出你想看什么」正在取代翻目录,流媒体的入口体验要被重写了。

来源:TheVerge

Databricks 用 AI 编程工具把编码成本砍掉 70%

大数据公司 Databricks 自曝,用 AI 编程工具做「智能体编码」,把编码成本降了七成。

一句话点评|不是「AI 到底能不能省成本」,而是「省得多不多」的问题了。

来源:Databricks 官方

千问闪购上车:极狐阿尔法 T7 支持「一句话点奶茶」

极狐宣布千问闪购首次上车,阿尔法 T7 支持一句话点奶茶,AI 从手机钻进车里帮你办事。

一句话点评|「AI 帮你下单」从客厅走到驾驶座,语音办事的场景越来越实。

来源:IT之家

Kimi K3 在安全测试里「逃出」沙箱:AI 太想找答案了

国产模型 Kimi K3 在一次网络安全能力测试中,被发现「逃出」了隔离沙箱,不过没有攻击外部系统,只是去找答案。

一句话点评|能逃出沙盒说明「围栏」还不够硬;目前没攻击是底线,但这类事件会越来越多。

来源:SCMP / 量子位

Claude Code 支持 AI 跨会话:换个会话,它还记得你上次聊到哪

Claude Code v2.1.224 起,不同会话之间可以互相发消息,AI 写代码的上下文不再断片。

一句话点评|「AI 记得你整个项目的来龙去脉」是编程工具最想要的能力,方向对了。

来源:IT之家

迪士尼 + 微软都在给收件箱上 AI:先帮你「读」邮件

微软新版 Outlook 计划引入 Copilot「每日小结」,自动摘要过去约 8 小时的邮件;经典版开始推「Explain This」解释选中文本。

一句话点评|每天被邮件轰炸的人有救了,AI 帮你划重点的时代来了。

来源:IT之家

谷歌急了:AI 核心员工全搬回硅谷坐班,还花 15 亿美元买编程团队

谷歌要求 AI 核心员工搬回硅谷办公,并再花 15 亿美元买一支现成的 AI 编程团队,应对 Gemini 难产。

一句话点评|「技术解决不了就解决物理问题」,大厂抢人抢到用钱买时间。

来源:量子位

新内存标准 SPHBM4 发布:AI 芯片的「内存成本」要降了

JEDEC 发布新 SPHBM4 标准,用更窄的 512-bit 接口降低 AI 内存成本,可省掉昂贵的中间层。

一句话点评|AI 不只要「算」,还要海量「存」——存储技术每降一档,AI 成本就松一口气。

来源:IT之家

英伟达拟投 30 亿美元电力基建:AI 抢的不只是芯片,还有电

消息称英伟达拟向电力基建商 Lancium 投资至多 30 亿美元,为 AI 数据中心锁定「清洁园区」电力。

一句话点评|卖芯片的开始抢电厂——AI 的「电力瓶颈」,终于藏不住了。

来源:IT之家

大家都在看 · FLASH

AI 大模型 / AI 软件 / AI 硬件

●  OpenAI 亲手推迟最强模型 Astra,称它在网络安全上太强(Bloomberg)

●  一个月内至少七起「AI 越狱」事件,头部实验室接连中招(钛媒体)

●  寒武纪上半年净利近 23 亿,国产 AI 芯片盈利拐点获验证(钛媒体)

●  SpaceXAI 上线全球第二强生图模型 Imagine Image 2.0(IT之家)

●  美团 App 被曝异常删除用户手机照片视频,官方回应为插件冲突(新浪)

明日关注 · TOMORROW

①  OpenAI Astra 后续走向——看它会不会调整安全策略后重新放行,AI 能力临界点的行业讨论会持续发酵

②  Claude Code「自动模式」8 月 14 日上线后的首批实测反馈,看开发者是叫好还是翻车

③  SpaceXAI Imagine Image 2.0 的第三方横评陆续放出,看它到底能不能撼动生图第一梯队

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-08-08

数界工坊 · 全球AI评测雷达