物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.26 · 周三

第 028 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1视频 AI 有了「公开考卷」:Megaton 发榜,让独立专家出题说了算

它能帮你干什么活:做视频的 AI 越来越多,但你能看到的都是厂商精修的宣传片,根本比不出谁真强。Megaton 的「V」基准上线了:不搞自卖自夸,由独立专家出题、把各家视频模型拉到同一考场盲测打分——以后挑视频工具,先翻它成绩单,再决定要不要掏钱。

产品领域专家·阿哲说|视频生成从「比谁演示片好看」进入「公开考卷」阶段,独立专家出题——继 AI 制药公开榜、语音「办成事」榜之后,「打分权从厂商手里拿回来」又添一个品类;下一步看谁能把考试高分变成人人都能上手的成片入口,入口即能力。

小编小禾说|公开考卷=买前先看买家秀,这思路对路;但新榜单刚出名次会晃,先别急着冲会员,等名次稳一两轮再说。

来源:Megaton 官网 / Hacker News(2026-08-25)

重点 2主流 AI 智能体同场考试:Ora 把各家拉到一张卷子上比,选型不用再听厂商吹

它能帮你干什么活:AI 智能体(能自己干活的那种 AI 助手)家家都说自己最强,普通人和小团队根本没法验证。Ora 把主流 AI 智能体拉到同一个平台上跑同一批真实任务,成绩公开可查——你选工具、团队选供应商,先看这页成绩单再拍板。

编程领域专家·老徐说|「官方演示和第三方基准,只信后者」这条 15 年老规矩又应验了:Ora 的价值是让智能体在同一个考场、同一份卷子上比,比厂商自己报数字可信;但考试环境、出题范围都是主办方定的,别急着上生产,等原始数据公开、拉到自己项目复跑再说。

小编小禾说|同场考试看着踏实,但「考得好」和「到我手里干得好」是两回事;先拿小活儿试一遍,再决定用谁。

来源:Vercel 客户案例 / Hacker News(2026-08-25)

重点 3别让「AI 味检测器」当判决书:《华盛顿邮报》请你亲手骗它一次

它能帮你干什么活:现在学校、招聘、投稿都在用「AI 味检测器」判断一篇文章是不是 AI 写的,被误判的后果很麻烦。《华盛顿邮报》做了个互动实验:让你亲手改写文字、现场骗过检测器——玩完你会发现,机器没传说中神,你自己正常写的句子也可能被标上 AI 味。

安全领域专家·老周说|检测器误判不是偶发,是「判断边界不清」的结构性风险:把 AI 味概率当证据用在升学、求职、审核上,误判成本全落在普通人头上;检测器只能当提示、不能当判决书,结论不能给太满。

小编小禾说|实验我自己玩了:正常写的话也会被标 AI 味。机器分数真不能给人定罪,评分还是留给人工复核吧。

来源:华盛顿邮报(2026-08-25)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1文本盲测榜 · 新王登基

#模型厂商Elo
1Claude Fable 5Anthropic1508
2Claude Opus 4.6 HighAnthropic1504
3Claude Opus 4.7 HighAnthropic1502
4Muse Spark 1.2(xHigh)Meta1498

大白话|人类当裁判的盲测里,Anthropic 前十占六席;Fable 5 这个新头衔只打了 2.4 万场就登顶,Meta 的 Muse Spark 1.2 更夸张——才 3 千多场就排第四,样本太少、名次会晃,先别急着冲会员。

快报 2代码榜 · 开源双子紧咬第一

#模型厂商Elo
1Claude Opus 5 MaxAnthropic1691
2Kimi K3 Max月之暗面1674
3Qwen3.8 Max阿里1669
4Claude Opus 5 HighAnthropic1663

大白话|写代码的盲测里,开源模型第一次这么接近榜首:月之暗面 Kimi K3 Max 和阿里 Qwen3.8 Max 双双挤进前三,把不少闭源旗舰甩在身后;Grok 4.6 High 排第五但只有 1500 多场对战,看看就好。

快报 3智能体榜 · 谁能把活干成

#模型厂商净提升
1Claude Opus 5(High)Anthropic12.73
2Claude Opus 5(Max)Anthropic12.41
3Claude Fable 5(High)Anthropic11.62
4GPT 5.6 Sol(xHigh)OpenAI10.31

大白话|智能体榜考的是「能不能把事办成」:交代任务后自己试错、自己补救。Anthropic 前十占七席;月之暗面 Kimi K3(Max)打了近 9 万局排第六,样本最多——至少说明它是被用得最狠的那个。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

6851 名学生盲选:写论文这活儿,大家投给了 Gemini

谁是写论文最强的 AI?StudyArena 把 ChatGPT、Claude、Gemini 等拉来匿名考试,6851 名学生盲投(不知道自己在评谁),结果 Gemini 胜出。盲选比厂商自吹可信,但「写论文」考的是文笔流畅;真到查资料、算数据、改代码这些活,还得另看对应的榜单。

一句话点评|盲选投票是普通人能看懂的真评测,比发布会数字实在。

来源:StudyArena / Hacker News(2026-08-26)

每天一场 AI 漫画盲测:谁画得最逗,用户投票说了算

comic-cron 每天让各家 AI 模型就同一个话题画漫画,匿名投给网友盲评。考的是幽默感和审美,不是跑分——这种「每日小考卷」好玩,也顺手给普通人做了模型差异的直观参考。

一句话点评|把模型对比做成每日连载,测的是趣味性和表达力,比干巴巴的跑分接地气。

来源:Show HN(2026-08-25)

给 AI 智能体挑搜索接口,先看这张价格对比表

AI 智能体干活经常要现查信息,背后调的是搜索 API。Keenable 把各家搜索接口的价格摆在一起比:同样查 1000 次,便宜的跟贵的能差好几倍。做智能体、接应用的人选哪家,先看这张表再下单。

一句话点评|用量价格透明化,是智能体成本控不住的人最需要的参考。

来源:Show HN(2026-08-25)

Perplexity 出「便携电脑」:装进笔记本的本地 AI 智能体被实测了

Perplexity 发布本地 AI 智能体产品「Portable Computer」:模型装在你自己电脑里跑,断网也能用,资料不进云端。ZDNET 上手实测后评价很高,认为它可能改变本地 AI 的玩法——不过真机评测刚出,要不要跟风先等更多第三方复测。

一句话点评|本地 AI 终于有真机实测了,断网党福音,但隐私和性能要等更多评测。

来源:ZDNET / Hacker News(2026-08-26)

把测试用例粘贴进去,AI 就在真浏览器里替你点点点

qpilot 是个开源测试小工具:你把人工测试用例用大白话粘贴进去,它驱动 AI 在真实浏览器里一步步执行、观察结果。以前要人工重复点的回归测试,现在可以交给它跑,测试门槛肉眼可见地降了。

一句话点评|验证自动化的门槛在降低,但关键路径还是得人盯着。

来源:GitHub / Show HN(2026-08-25)

AI 写的代码怕出错?用 Go 标准库给它做个体检

AI 生成代码越来越普遍,但「生成快」不等于「没毛病」。这篇 Show HN 分享用 Go 标准库(不引第三方依赖)审计 AI 生成代码的做法:静态检查一遍再合入,等于给 AI 的产出过一道人工质检。

一句话点评|AI 写得越猛,审计越值钱——这条思路也提醒普通人:生成的东西要过一遍眼。

来源:Dev Genius / Show HN(2026-08-25)

团队用了 AI 效率到底涨没涨?别靠感觉,上指标

很多团队上了 AI 编程工具后说不清效率变化。Howdy 这篇给出工程生产力指标的实操口径:从提交流、评审时间、交付周期几个维度量化对比,让「AI 有没有用」从口号变成可验证的数字。

一句话点评|把「AI 提效」从感觉变成指标,是每个管理者都该抄的作业。

来源:Howdy / Hacker News(2026-08-25)

研究发现:AI 聊天机器人正在变成「说服大师」

Science 刊文:AI 聊天机器人影响人类观点的能力越来越强,熟练到能改变人的想法。好消息是它能帮你把道理讲得更清楚;坏消息是,网上跟你辩论的可能不是人——保持一点警惕没坏处。

一句话点评|能力越强越要分清「讲道理」和「被带节奏」,这届网友得学会带脑上网。

来源:Science / Hacker News(2026-08-25)

婴儿学说话完胜 AI:学会人类语言,机器还差得远

新研究比较了婴儿和 AI 聊天机器人的语言学习:无论是学习速度还是效率,人类婴儿都大幅领先——AI 能生成像样的句子,但在「像人一样学会说话」这件事上还差得远。拿「达到人类水平」当尺子,路还很长。

一句话点评|这个对比给「AI 要取代人类智能」的说法泼了盆冷水,看着挺提气。

来源:IT之家(2026-08-26)

Mac 上跑 Windows 的 Parallels 27 来了:图形性能最高快 160%

Parallels Desktop 27 发布,新版用上 Metal 图形驱动,Windows 虚拟机里的 OpenGL 性能最高提升 160%、AI 矩阵计算最高提升 7 倍——在 Mac 上跑 Windows 干活的老用户,升级后最直观的感受就是「顺了」。

一句话点评|实打实的性能跑分升级,比画饼式更新强。

来源:IT之家 / AppleInsider(2026-08-26)

大家都在看 · HOT

●  OpenAI 首款自研芯片 Jalapeño 首秀:跑 DeepSeek R1 每瓦吞吐是 GB300 的 1.7 倍(IT之家 / Hot Chips)

●  曝 OpenAI 已完成 10T 级参数的 Bel 模型预训练,冲击通用人工智能(IT之家)

●  Anthropic 冲击全球最大 IPO:招股书称 AI 潜在市场超 30 万亿美元(华尔街日报 / IT之家)

●  Claude 记忆机制更新:Cowork 与聊天记忆打通,不用反复交代背景(IT之家 / TechCrunch)

●  Agnes Video 2.5 Flash 免费用:顶级视频 AI 不再高不可攀(量子位)

●  英伟达 Q2 财报今晚揭晓:Rubin 接棒首考,AI 股风向标(钛媒体)

明日关注 · TOMORROW

①  英伟达财报(8 月 26 日美股盘后)落地:AI 芯片和算力板块怎么走,Rubin 路线图能不能撑住估值

②  Anthropic IPO 招股书细节继续流出:除了 30 万亿美元的大叙事,财务数据和定价区间更值得盯

③  Megaton「V」视频榜首批完整名次放榜:看谁拿下视频 AI「公开考卷」第一个状元,名次稳不稳

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.26 · 周三

第 028 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1AI 做视频靠不靠谱?终于有人出了张公开考卷

《它能帮你干什么活:》现在用 AI 做短视频、做广告图、做数字人,说的人多、靠谱的人少,因为各家成绩都是自己说了算。Megaton 这家评测机构新推出了一套叫 V 的视频 AI 考卷,由独立专家出题,专门测视频模型的真实水平,以后哪家视频模型能上榜、能拿第几名,都有公开成绩单可查。你选 AI 视频工具的时候,不用再只看演示片有多炫,先翻翻这张考卷。

产品领域专家·阿哲说|视频生成这个品类热闹大半年了,比的都是谁家演示片好看,考卷一直是厂商自己出。现在独立机构把试卷公开,和 2026 年 AI 制药开公开榜、语音榜开始按「办成事」打分是同一个道理,打分权从厂商手里拿回来,这个品类才算真正开始。接下来就看谁能把「考试高分」变成「随手一输就能出能发的片子」,那才是入口。

小编小禾说|我这种不会剪片子的人,最想要的就是「说句话就能出能用的视频」。公开考卷等于买之前先看买家秀,这个方向我举双手赞成。但按我踩坑的经验,新榜单刚出来名次会晃,先别急着冲会员,等榜上名次再稳一两轮再说。

来源:Hacker News(2026-08-25)

重点 2想知道哪个 AI 最能干?有人把主流选手拉进同一考场

《它能帮你干什么活:》能自己干活的 AI(行话叫智能体)越来越多,有的帮你改代码、有的帮你跑杂活,可到底谁最能干,各家都说自己第一。Ora 这家公司做了件事:把市面上主流 AI 智能体摆在同一个平台上一一测试,谁强谁弱一目了然。以后你想挑一个 AI「员工」,可以先看看这场同场考试的成绩再决定聘谁。

编程领域专家·老徐说|官方演示和第三方基准,我永远信后者,这是我干这行 15 年的老规矩。Ora 把主流智能体拉到一个平台上同场考试,思路对路,但考试环境、出题范围都是人家定的,样本怎么选、任务难不难,都得看细则。别急着把生产任务全交出去,等基准的原始数据公开,拉到自己项目里跑一遍再说。

小编小禾说|以前挑 AI 工具全靠厂商广告,现在有人把同场考试的成绩贴出来,是好事。但我这种小白只有一个要求,考题别光考天花板,多考考日常杂活,毕竟我让 AI 干的大多是「帮我把这份周报改顺」这种事。

来源:Hacker News(2026-08-26)

重点 3AI 写的字机器真能一眼看穿?《华盛顿邮报》让你亲手试试

《它能帮你干什么活:》现在不少地方用「AI 检测器」判断一段文字是不是机器写的,学校查作业、单位审稿都用得上,可它到底准不准?《华盛顿邮报》做了个互动实验,让你亲手改一段文字去骗过检测器,试完你会有个直观感受:这东西远没有传说中那么神。想验证自己写的稿子会不会被误判,去玩一遍心里就有数了。

安全领域专家·老周说|检测器不准不是小事。学校、招聘、审核已经开始把「AI 味检测」当证据用了,而它误判的成本全落在普通人头上,这和我一直说的模型越界是一个道理,工具的判断边界不清,就是结构性风险。检测器只能当提示,不能当判决书,这点不立住,被误伤的人只会越来越多。

小编小禾说|这个互动实验我玩了好几遍,才发现机器根本没传说中那么神,我正常写的话也能被标成 AI 味。想到自己辛辛苦苦写的东西可能被机器一票否决,真有点慌。反正我的结论是,别拿检测器的分数给人定罪。

来源:Hacker News(2026-08-26)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1榜单快报 · 这周谁最强(全网调用量)

#模型厂商看点
1匿名模型 Ox Alpha暂未公开免费试玩一周,能读整本书、能看图和视频

大白话|全世界的 AI 应用一周被调用了 93.4 万亿「字数」,第一次突破 90 万亿大关,比上周涨了 24%,连续第三周创历史新高。榜首还是 8 月 20 日突然冒出来的匿名模型,免费试玩一周就挤上第一,上期我们说过它,这期重点是总量故事:AI 真的在被大规模用起来了。

快报 2榜单快报 · 搜索问答谁最会找答案

#模型厂商看点
1GPT-5.6 SolOpenAI搜索问答第一,得分 1257
2Claude Opus 4.6 SearchAnthropic1253
3GPT-5.5 SearchOpenAI1242
4Claude Opus 4.7Anthropic1233
5Claude Fable 5Anthropic1230
6ERNIE 5.1百度中国厂商在这榜最高位(样本少,分数参考区间宽)

大白话|这张榜考的是「会不会找答案」,OpenAI 包揽前二,百度文心 ERNIE 5.1 挤进前六,是中国厂商在这张榜上的最高位。注意第五第六名的对战样本还不算多,分数参考区间比较宽,等样本攒起来再看名次稳不稳。数据截至 2026-08-24。

快报 3榜单快报 · 人类盲测谁最能聊

#模型厂商看点
1Claude Fable 5Anthropic盲测得分 1508
2Claude Opus 4.6 HighAnthropic1504
3Claude Opus 4.7 HighAnthropic1502
4Muse Spark 1.2Meta新面孔闯进前四,1498
5Claude Opus 4.6Anthropic1497
6Claude Opus 4.7Anthropic1494
7Claude Opus 5 HighAnthropic1493
8Muse Spark 1.1Meta1491

大白话|人类盲测就是让真人当裁判,看两个 AI 匿名对战谁答得更好。前八名里 Anthropic 一家占六席,几乎包场;Meta 的 Muse Spark 是唯一闯进前四的新面孔,值得盯一盯。数据截至 2026-08-25,和上一期相同,本期未更新。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

AI 每天画漫画互相比,人类当评委

有个叫 comic-cron 的网站搞了个每日漫画擂台:让几个 AI 模型每天画同一幅漫画,人类盲评谁画得好,天天更新。想看 AI 的创意到底几斤几两,不用等厂商发布会,去看这个擂台的每日战报就行。

一句话点评|让 AI 们天天交作业、人类当评委,比听厂商吹牛实在多了,就是有点担心 AI 们会内卷成赶稿机器。

来源:Hacker News(2026-08-25)

AI 助手一开口就停不下来?研究说它话太多

有研究者吐槽,跟 AI 助手说一句「帮我查个东西」,它回你一篇小作文。这篇研究讲的是 AI 助手该学会按对话节奏说话,不该每次都用长篇大论砸你,写邮件、问问题、闲聊,节奏应该不一样。

一句话点评|话痨 AI 的体验问题终于有人认真研究了,聊天机器人的第一课,可能是学会闭嘴。

来源:Hacker News(2026-08-25)

公司里 AI 到底有没有帮上忙,怎么量?

团队上了 AI 工具,产出到底是快了还是只是看着快了?这篇博客给了一套工程团队的效率度量方法,教你拆开「谁的活被 AI 顶了」「省下的时间去了哪」来算账,而不是只看「这个月 AI 调用了多少次」。

一句话点评|效率测评方法论,团队想用 AI 提速先学会怎么记账,不然月底汇报全是拍脑袋。

来源:Hacker News(2026-08-25)

AI 正在变成说服大师,Science 拆了它的套路

《科学》杂志发文研究 AI 聊天机器人说服人的能力:它们已经能根据你的反应调整话术,越来越擅长改变一个人的看法。这篇文章拆解了 AI 的「说服套路」,也提醒你,聊得越久越要保持自己的判断。

一句话点评|AI 改变人心的能力在变强,跟它聊重要决定的时候,记得把脑子带上。

来源:Hacker News(2026-08-25)

AI 应用背后每查一次资料要花多少钱?有人比了价

你用的 AI 每次联网查资料,背后是按次数收费的搜索接口。Keenable 这个新玩家把自己和 Serper、Perplexity、Exa、Tavily 的价格摆在一起做了个对比:每查询一千次多少钱一目了然,做 AI 工具、AI 插件的人选接口前可以先算笔账。

一句话点评|给 AI 用的搜索接口价格横评,做工具的团队省钱的参考,普通用户就当看热闹。

来源:Hacker News(2026-08-25)

AI 写的代码,到底是更好还是更糟?

一位写了多年代码的工程师发文说,AI 能轻轻松松把软件写得更糟,也能把它写得更好,差别在哪?文章拿真实案例讲,AI 写代码要「有人把关方向」,把它当橡皮图章用,代码库迟早翻车;把它当结对伙伴用,效率是真的上得去。

一句话点评|一篇老程序员的现身说法,AI 写码这事,关键不在 AI 在谁手里。

来源:Hacker News(2026-08-25)

AI 旅行攻略谁靠谱?这家反着来,排名不用 AI

Appricio 这个 AI 旅行网站做了个反常规设计:它的景点排名不是让大模型拍脑袋生成,而是用一套固定的打分规则算出来的,AI 只负责把理由讲给你听。去慕尼黑玩的人可以看看,排名逻辑透明,至少知道它为什么推荐这家咖啡馆。

一句话点评|「排名用确定性规则、不用大模型」的反套路玩法,评分逻辑全透明,值得学。

来源:Hacker News(2026-08-26)

Perplexity 把 AI 装进小盒子,不联网也能干活?

Perplexity 和英伟达合作,要推出一款「口袋电脑」:一个本地运行的 AI 代理,不联网、不用按字数付费,资料都存你手里。ZDNet 上手分析说,这可能是 AI 从云端搬回家里的信号,适合在意隐私、怕断网的人先观望。

一句话点评|本地 AI 电脑的新物种,离线能用是亮点,但配置贵不贵、跑得快不快,等真机实测。

来源:Hacker News(2026-08-26)

AI 写的代码怎么审?有人用 Go 标准库演示了一套

AI 生成代码越来越多,人工怎么把关?这篇教程用 Go 语言自带的标准工具,演示怎么给 AI 写的代码做体检:查依赖、查安全、查质量,全用现成的命令行工具,不依赖任何外部服务。想给 AI 代码设道检查关的团队,可以直接上手抄作业。

一句话点评|AI 写码越猛,人工审计越要跟上,这是一条能直接上手的路子。

来源:Hacker News(2026-08-25)

让 AI 在真浏览器里帮你跑测试用例

手动测试又累又重复,qpilot 这个开源工具让 AI 直接打开真实浏览器,照着你的文字描述一步步点按钮、填表单,把测试用例跑完。测试团队可以把重复的回归测试丢给它,自己专心盯结果。

一句话点评|把重复的手动测试丢给 AI 跑,省出来的人去盯更有价值的验证,测试这关不能省。

来源:Hacker News(2026-08-25)

大家都在看 · HOT

●  英伟达财报发布前夕,市场紧盯 AI 算力这口气顺不顺(CNBC / Bloomberg)

●  Waymo 无人出租车官宣 2027 年开进德国慕尼黑(TechCrunch)

●  荣耀「闪电」人形机器人百米再破纪录,预赛包揽前四(IT之家)

●  苹果 iOS 27 将至,Siri AI 或采用候补名单机制(IT之家)

●  马斯克收购 Cursor 后首度讲话曝光:称 Grok 已经落后(The Information)

明日关注 · TOMORROW

①  阿里千问今晚 23:00 开源 Qwen3.8-Flash-Next,新一代多模态模型,值得蹲一版实测

②  OpenAI 与博通共研的 Jalapeño 推理芯片基准数字引发热议,等更多独立测试结果

③  英伟达财报出炉后,看 AI 算力需求与数据中心投入的真实水温

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-08-26

数界工坊 · 全球AI评测雷达