物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.13 · 周四
第 015 期
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 4 组 | 板块精选 13 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1DeepSeek V4 Pro 空降 LiveBench:77.4 分,答对一题只花 4 分钱
它能帮你干什么活:LiveBench 是出了名的「防作弊考场」——题目半年一换、杜绝真题泄露,所以分数比一般榜单实在。最新榜单上,DeepSeek V4 Pro 以 77.4 分空降,离第一梯队(Claude Fable 5 的 83.0)只有 6 分差距;更夸张的是成本,每成功完成任务平均只要 4.4 美分(约 3 毛钱人民币),全场最低档。想省钱又想要接近顶级的 AI,这个数字很值得记住。
编程领域专家·老徐说|77.4 分放在半年前得卖十倍价。DeepSeek 的打法一直没变:用十分之一的价格做到九成能力,让「够用」变成「真香」。我上个月就说过,调用量是市场用脚投票的硬指标——这次空降 LiveBench,等于把「便宜」和「强」同时写进了官方成绩单。不过我还是要泼盆冷水:榜单分数归榜单,接进真实项目的稳定性,先等第三方实测。
小编小禾说|我用 DeepSeek 写过周报、排过行程,说实话和贵好几倍的模型差别不大。它最打动我的是响应快、不啰嗦,凌晨三点改稿子它还在线。3 毛钱一题的价格,我都不需要纠结「今天该省着点用」。
来源:LiveBench(2026-06-25 版榜单)/ IT之家
重点 2AI 智能体盲测榜:Anthropic 三连冠,Kimi K3 是中国牌面
它能帮你干什么活:如果你想找「最能干活的 AI」而不是「最能聊天的 AI」,看 Arena 智能体盲测榜。真人裁判、不看品牌、真刀真枪对战:Claude Fable 5、Opus 5 系列包揽前三,OpenAI 的 GPT-5.6 Sol 排第四,月之暗面 Kimi K3 以 10.43 分排第五,是中国模型最高名次。榜单六项维度里,还有「命令恢复」这种考「搞砸了能不能自己修好」的硬题。
安全领域专家·老周说|智能体榜比聊天榜难刷——它考的是「干活的可靠性」。Kimi 能挤进前五是实打实的信号,说明国产模型在「干活」这个维度真的追上来了。「命令恢复」能进考试科目,说明行业已经开始把「AI 犯错后能否自己兜底」当成硬指标,这也是一种边界意识:能力越强,越要防住「越界」。权限该设最小还是要设最小,别因为分数高就乱授权。
小编小禾说|我这两天正好在试用智能体帮我整理会议纪要和跟进任务。体验是:它能干 80% 的活,剩下 20% 需要我兜底——好在它干砸了会老实说。榜单上那一两分的差距,落到日常使用,可能就是一句话的差别。
来源:Arena 智能体盲测榜(快照 2026-08-11,8/12 抓取)
重点 3蚂蚁开源小模型 Ling 3.0 Tiny,被 123 项测试「红队」盘了个底朝天
它能帮你干什么活:开源小模型的极限在哪?独立评测团队对蚂蚁开源的 Ling 3.0 Tiny(免费版)做了123 类「红队」测试、累计 391 条记录:越狱防护、敏感内容、逻辑一致性、指令跟随……像体检一样全身查一遍。结果有扛住的、也有当场破功的,哪类强哪类弱,报告列得清清楚楚——这也是开源模型「敢让人随便盘」的透明度红利。
安全领域专家·老周说|这种第三方红队全身体检,比厂商自吹的跑分值钱多了。391 条记录、123 个类别,逐类给结论,等于把底裤翻给用户看。我一直强调边界和护栏——小模型能力没那么强,反而更容易在边界上翻车。开源模型敢这么被盘,本身就是态度;至于报告里暴露的弱点,正是用户使用前该知道的「说明书」。
小编小禾说|第一次觉得 AI 的「体检报告」我也能看懂:哪些项扛住了、哪些项当场破功,清清楚楚。这种把缺点摆在明面上的做法,反而让我更敢用它——起码我知道它的底线在哪。
来源:lateos.ai 红队报告 / Hacker News(2026-08-13)
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1AI 智能体盲测榜(TOP 5)
大白话|真人当裁判的盲测里,Anthropic 成了「常胜将军」,Kimi K3 是中国牌面。榜单还考「搞砸了能不能自己修」,这题比聊天水平实在。
快报 2「智能指数」综合榜(把能力、价格、体验揉在一起的评分 TOP 5)
大白话|综合实力拼性价比,开源阵营第一名还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「几分之差」。
快报 3LiveBench 总分榜:谁在「防作弊考场」里领先
大白话|DeepSeek 空降 77.4 分、单任务成本 4.4 美分全场最低档——「便宜大碗」这次写进了官方成绩单。
快报 4智能体新榜单:Solar Pro 4 首秀 + 记忆基准首测
・ 韩国 Upstage 发布 Solar Pro 4(512K 上下文窗口、商用智能体定位),首次亮相 Agent Arena 排名 44,与 MiniMax M2.7 同级(IT之家)。
・ Agent Memory Leaderboard 公开首批结果:给智能体「记忆系统」做基准——长上下文、人设、脚本与对话记忆四个维度打分(Hacker News)。
大白话|智能体竞争开始考「记得住」和「会干活」——连记忆都能量化打分,说明这条赛道越来越像正经工程了。
13 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
「Can you tell if a comment is AI?」:七个话题,人机评论盲测上线
一个新开的网页小游戏:同一篇文章下的七段评论,一段来自真人社区、一段来自 AI,让你猜哪段是 AI 写的。七个话题、七场对战,越到后面 AI 越难分辨。
一句话点评|测的不只是模型,更是你对「人味」的敏感度——AI 正在把「像人说话」练得越来越像。
来源:talkshi.com / Hacker News
智能体「沙箱」能防逃逸,但不会告诉你里面发生了什么
技术博客复盘:Docker 沙箱、微虚拟机确实能拦住智能体「跑出去」,但运行时黑盒——它干了什么、改了什么、为什么失败,全部不可见。防住了「越界」,却丢了「审计」。
一句话点评|安全性和可观测性,是智能体落地前必须补的两门课——光能关住不够,还得看得见。
来源:rye.ai / Hacker News
Silicon Data 融资 3050 万美元:给「算力性能」做标准答案
一家专做 AI 算力性能基准评测的公司 Silicon Data 完成 3050 万美元融资。随着「谁的算力快、谁的模型强」成为采购决策依据,基准评测本身变成了一门生意。
一句话点评|连「评测算力的评测」都有人投钱了——AI 淘金热里,卖尺子的也在发财。
来源:Bloomberg
NagaAI:比 Poe、OpenRouter 更便宜的 AI 聚合器
又一个 AI 聚合器上线:一个入口调多家模型、按量付费,主打「更便宜」。聚合器赛道从「比模型多」卷到「比价格低」。
一句话点评|聚合器开始拼价格,用户是最大赢家——但便宜之外,稳定性和隐私要看仔细。
来源:Hacker News
CrewScore:给智能体提示词做「覆盖率体检」
新工具 CrewScore 上线:自动检查你的智能体提示词覆盖了哪些分支场景、哪些没覆盖,相当于给 Prompt 写「单元测试覆盖率」。
一句话点评|提示词工程正在变成「测试工程」——覆盖率的说法,早晚会进大家的工作流。
来源:Hacker News
Dynobox:开源智能体技能「测试跑道」
开源项目 Dynobox:给智能体的技能和工作流搭测试跑道——真实跑一遍、记录证据、对工具调用和文件结果做断言。AI 开发者的单元测试,终于有了趁手工具。
一句话点评|智能体开发进入「有测试再上线」阶段,这是工程化的重要一步。
来源:GitHub / Hacker News
让 AI 写小说,实测:「不算差」
一位作家让 AI 基于自己的既有手稿续写小说,实测结论:文笔不算差、结构不出错,但少了作者本人的「气味」——那种只属于人的、无法参数化的东西。
一句话点评|AI 文学的下限已经不低,上限还差口气——差的那口气,恰恰是最值钱的。
来源:Mother Jones / Hacker News
Roku 上线 AI 影片频道,第一波口碑「AI 味太冲」
Roku 推出号称全球首个 AI 电影频道 Fairground,装满 AI 生成的影片。上线即被吐槽:内容同质化、质感廉价,「AI 味」盖过了电影味。
一句话点评|AI 内容能不能留住观众,第一波市场反馈不太妙——工具再强,审美还是硬门槛。
来源:The Guardian
调查:超 80% 日本公司还没全面拥抱 AI
路透社调查:超过 80% 的日本公司尚未在业务中全面引入 AI,主要卡在流程改造和员工培训,而非技术门槛。日本企业的「AI 慢半拍」被数据坐实。
一句话点评|AI 普及的差距藏在企业流程里,不在技术里——会改流程的,才是赢家。
来源:路透 / BBC
TokenMaxxer:跟朋友比谁 AI 花钱多
新玩具上线:把大家的 AI 调用量、花费拉一个排行榜,跟朋友比谁「烧的 token 多」。AI 消费主义的新形态:花钱也要卷。
一句话点评|AI 使用量从「生产力指标」变成「社交货币」,说明真金白银花在 AI 上的人越来越多了。
来源:Hacker News
6000+ 条 AI 编程智能体真实事故复盘:Cursor 问题最多
约克大学与卡尔加里大学研究团队爬取 2023 年 2 月至 2026 年 3 月 Reddit 上 3801 个与编程 AI 相关的帖子,整理出 6000 多条真实安全事故:AI 智能体因权限过大而覆盖文件、删除重要数据,甚至生成恶意代码——其中围绕 Cursor 的讨论最多。
一句话点评|工具越强大,权限护栏越重要——「默认最小权限」该成为 AI 编程工具的产品标配,而不是用户自己去配。
来源:IT之家 / 约克大学研究(2026-08-13)
三星用 AI 压缩芯片验证循环:提速 15–30 倍
Hacker News 工程笔记复盘三星实践:在芯片验证环节引入 AI,把「发现问题—修复—复验」的迭代循环压缩了 15–30 倍。收益最大的场景共性很明确——数字化、可测试、可重复的任务。
一句话点评|芯片验证是 AI 最难啃的硬骨头之一,三星把「15–30 倍」写进工程笔记,比任何发布会都实在。
来源:Hacker News(2026-08-13)
机器人基础模型 DYNA-2:超 100 万小时人类视频训练,任务成功率 90%
具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超过 100 万小时的第一人称人类视频训练,任务成功率最高达 90%,官方定位为「世界动作模型」——通过观察人类操作来学习干活。
一句话点评|机器人「看视频学动作」的路线被数据验证,通用机器人离「上手就会」又近了一步。
来源:IT之家(2026-08-13)
AI 大模型 / AI 软件 / AI 硬件
● Ilya 创办的 SSI 首个模型曝光:押注「测试时训练」持续学习新路线(量子位)
● 谷歌 Pixel 11 发布:最强 Agent 版 Gemini 站 C 位,AI 手机大战开打(CNBC)
● 富士康 AI 服务器营收首破 51%,iPhone 占比降至 29%(IT之家)
● CoreWeave 证实 A100 可服役至 2029 年,GPU 寿命远超预期(IT之家)
● Claude 上线 Chrome 侧边栏,对话历史全平台互通(IT之家)
① DeepSeek V4 Pro 这波热度过后,LiveBench 各分榜会不会被它继续刷新?77.4 分的「性价比王座」能坐多久?
② 智能体盲测榜新增「命令恢复」维度(搞砸了自己修),国产模型能不能借这题再进一步、冲进前三?
③ 智能体真实事故复盘出炉(Cursor 问题最多)之后,AI 编程工具会不会把「权限最小化」当成新卖点?
—— 以下为早上预览版 ——
物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.13 · 周四
第 015 期 · 预览版
别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1DeepSeek V4 Pro 空降 LiveBench:77.4 分,答对一题只花 4 分钱
它能帮你干什么活:LiveBench 是出了名的「防作弊考场」——题目半年一换、杜绝真题泄露,所以分数比一般榜单实在。最新榜单上,DeepSeek V4 Pro 以 77.4 分空降,离第一梯队(Claude Fable 5 的 83.0)只有 6 分差距;更夸张的是成本,每成功完成任务平均只要 4.4 美分(约 3 毛钱人民币),全场最低档。想省钱又想要接近顶级的 AI,这个数字很值得记住。
编程领域专家·老徐说|77.4 分放在半年前得卖十倍价。DeepSeek 的打法一直没变:用十分之一的价格做到九成能力,让「够用」变成「真香」。我上个月就说过,调用量是市场用脚投票的硬指标——这次空降 LiveBench,等于把「便宜」和「强」同时写进了官方成绩单。不过我还是要泼盆冷水:榜单分数归榜单,接进真实项目的稳定性,先等第三方实测。
小编小禾说|我用 DeepSeek 写过周报、排过行程,说实话和贵好几倍的模型差别不大。它最打动我的是响应快、不啰嗦,凌晨三点改稿子它还在线。3 毛钱一题的价格,我都不需要纠结「今天该省着点用」。
来源:LiveBench(2026-06-25 版榜单)/ IT之家
重点 2AI 智能体盲测榜:Anthropic 三连冠,Kimi K3 是中国牌面
它能帮你干什么活:如果你想找「最能干活的 AI」而不是「最能聊天的 AI」,看 Arena 智能体盲测榜。真人裁判、不看品牌、真刀真枪对战:Claude Fable 5、Opus 5 系列包揽前三,OpenAI 的 GPT-5.6 Sol 排第四,月之暗面 Kimi K3 以 10.43 分排第五,是中国模型最高名次。榜单六项维度里,还有「命令恢复」这种考「搞砸了能不能自己修好」的硬题。
安全领域专家·老周说|智能体榜比聊天榜难刷——它考的是「干活的可靠性」。Kimi 能挤进前五是实打实的信号,说明国产模型在「干活」这个维度真的追上来了。「命令恢复」能进考试科目,说明行业已经开始把「AI 犯错后能否自己兜底」当成硬指标,这也是一种边界意识:能力越强,越要防住「越界」。权限该设最小还是要设最小,别因为分数高就乱授权。
小编小禾说|我这两天正好在试用智能体帮我整理会议纪要和跟进任务。体验是:它能干 80% 的活,剩下 20% 需要我兜底——好在它干砸了会老实说。榜单上那一两分的差距,落到日常使用,可能就是一句话的差别。
来源:Arena 智能体盲测榜(快照 2026-08-11,8/12 抓取)
重点 3蚂蚁开源小模型 Ling 3.0 Tiny,被 123 项测试「红队」盘了个底朝天
它能帮你干什么活:开源小模型的极限在哪?独立评测团队对蚂蚁开源的 Ling 3.0 Tiny(免费版)做了123 类「红队」测试、累计 391 条记录:越狱防护、敏感内容、逻辑一致性、指令跟随……像体检一样全身查一遍。结果有扛住的、也有当场破功的,哪类强哪类弱,报告列得清清楚楚——这也是开源模型「敢让人随便盘」的透明度红利。
安全领域专家·老周说|这种第三方红队全身体检,比厂商自吹的跑分值钱多了。391 条记录、123 个类别,逐类给结论,等于把底裤翻给用户看。我一直强调边界和护栏——小模型能力没那么强,反而更容易在边界上翻车。开源模型敢这么被盘,本身就是态度;至于报告里暴露的弱点,正是用户使用前该知道的「说明书」。
小编小禾说|第一次觉得 AI 的「体检报告」我也能看懂:哪些项扛住了、哪些项当场破功,清清楚楚。这种把缺点摆在明面上的做法,反而让我更敢用它——起码我知道它的底线在哪。
来源:lateos.ai 红队报告 / Hacker News(2026-08-13)
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1AI 智能体盲测榜(TOP 5)
大白话|真人当裁判的盲测里,Anthropic 成了「常胜将军」,Kimi K3 是中国牌面。榜单还考「搞砸了能不能自己修」,这题比聊天水平实在。
快报 2「智能指数」综合榜(把能力、价格、体验揉在一起的评分 TOP 5)
大白话|综合实力拼性价比,开源阵营第一名还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「几分之差」。
快报 3LiveBench 总分榜:谁在「防作弊考场」里领先
大白话|DeepSeek 空降 77.4 分、单任务成本 4.4 美分全场最低档——「便宜大碗」这次写进了官方成绩单。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
「Can you tell if a comment is AI?」:七个话题,人机评论盲测上线
一个新开的网页小游戏:同一篇文章下的七段评论,一段来自真人社区、一段来自 AI,让你猜哪段是 AI 写的。七个话题、七场对战,越到后面 AI 越难分辨。
一句话点评|测的不只是模型,更是你对「人味」的敏感度——AI 正在把「像人说话」练得越来越像。
来源:talkshi.com / Hacker News
智能体「沙箱」能防逃逸,但不会告诉你里面发生了什么
技术博客复盘:Docker 沙箱、微虚拟机确实能拦住智能体「跑出去」,但运行时黑盒——它干了什么、改了什么、为什么失败,全部不可见。防住了「越界」,却丢了「审计」。
一句话点评|安全性和可观测性,是智能体落地前必须补的两门课——光能关住不够,还得看得见。
来源:rye.ai / Hacker News
Silicon Data 融资 3050 万美元:给「算力性能」做标准答案
一家专做 AI 算力性能基准评测的公司 Silicon Data 完成 3050 万美元融资。随着「谁的算力快、谁的模型强」成为采购决策依据,基准评测本身变成了一门生意。
一句话点评|连「评测算力的评测」都有人投钱了——AI 淘金热里,卖尺子的也在发财。
来源:Bloomberg
NagaAI:比 Poe、OpenRouter 更便宜的 AI 聚合器
又一个 AI 聚合器上线:一个入口调多家模型、按量付费,主打「更便宜」。聚合器赛道从「比模型多」卷到「比价格低」。
一句话点评|聚合器开始拼价格,用户是最大赢家——但便宜之外,稳定性和隐私要看仔细。
来源:Hacker News
CrewScore:给智能体提示词做「覆盖率体检」
新工具 CrewScore 上线:自动检查你的智能体提示词覆盖了哪些分支场景、哪些没覆盖,相当于给 Prompt 写「单元测试覆盖率」。
一句话点评|提示词工程正在变成「测试工程」——覆盖率的说法,早晚会进大家的工作流。
来源:Hacker News
Dynobox:开源智能体技能「测试跑道」
开源项目 Dynobox:给智能体的技能和工作流搭测试跑道——真实跑一遍、记录证据、对工具调用和文件结果做断言。AI 开发者的单元测试,终于有了趁手工具。
一句话点评|智能体开发进入「有测试再上线」阶段,这是工程化的重要一步。
来源:GitHub / Hacker News
让 AI 写小说,实测:「不算差」
一位作家让 AI 基于自己的既有手稿续写小说,实测结论:文笔不算差、结构不出错,但少了作者本人的「气味」——那种只属于人的、无法参数化的东西。
一句话点评|AI 文学的下限已经不低,上限还差口气——差的那口气,恰恰是最值钱的。
来源:Mother Jones / Hacker News
Roku 上线 AI 影片频道,第一波口碑「AI 味太冲」
Roku 推出号称全球首个 AI 电影频道 Fairground,装满 AI 生成的影片。上线即被吐槽:内容同质化、质感廉价,「AI 味」盖过了电影味。
一句话点评|AI 内容能不能留住观众,第一波市场反馈不太妙——工具再强,审美还是硬门槛。
来源:The Guardian
调查:超 80% 日本公司还没全面拥抱 AI
路透社调查:超过 80% 的日本公司尚未在业务中全面引入 AI,主要卡在流程改造和员工培训,而非技术门槛。日本企业的「AI 慢半拍」被数据坐实。
一句话点评|AI 普及的差距藏在企业流程里,不在技术里——会改流程的,才是赢家。
来源:路透 / BBC
TokenMaxxer:跟朋友比谁 AI 花钱多
新玩具上线:把大家的 AI 调用量、花费拉一个排行榜,跟朋友比谁「烧的 token 多」。AI 消费主义的新形态:花钱也要卷。
一句话点评|AI 使用量从「生产力指标」变成「社交货币」,说明真金白银花在 AI 上的人越来越多了。
来源:Hacker News
AI 大模型 / AI 软件 / AI 硬件
● A股 AI 硬件盘中普涨:寒武纪大涨近 5%,摩尔线程站稳 579 元上方(问财行情)
● 谷歌 Pixel 11 发布:最强 Agent 版 Gemini 站 C 位,AI 手机大战开打(CNBC)
● 富士康 AI 服务器营收首破 51%,iPhone 占比降至 29%(IT之家)
● CoreWeave 证实 A100 可服役至 2029 年,GPU 寿命远超预期(IT之家)
● Claude 上线 Chrome 侧边栏,对话历史全平台互通(IT之家)
① DeepSeek V4 Pro 这波热度过后,LiveBench 各分榜会不会被它继续刷新?77.4 分的「性价比王座」能坐多久?
② 智能体盲测榜新增「命令恢复」维度(搞砸了自己修),国产模型能不能借这题再进一步、冲进前三?
③ 财报季进入深水区:Cerebras 暴跌 14% 之后,市场会不会重新审视 AI 芯片公司的估值体系?
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-13
数界工坊 · 全球AI评测雷达