大模型拿大结果指南

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
大模型拿大结果指南
8430点击    2026-09-01 14:20

大模型拿大结果指南


「严肃解读


懂模帝Bench黑客松是一个在网吧举行的严肃活动。


严肃在于,选手们在国窖畅饮(Man!)、豆汁爽喝之余,还真的做出了30个Bench,确实评测出了模型的优缺点。


两天下来,我的主要感觉是,人民群众的创意太丰富,反衬出目前主流Bench的匮乏。


后者成天折腾GitHub上的编程数据和越来越离谱的长程任务环境,对于非编程领域的能力是极度忽视的。


这其实说明懂模帝的思路有价值,让普通人来定义模型能力。Bench黑客松现场就没人做传统的主流的编程Bench,大伙都发挥了自己的创意。


有好几个模拟经营类考验模型综合智力的Bench。比如北漂模拟器、偶像出道模拟器、港股打新模拟器、洛杉矶急救调度员Bench。


也有测试环境设置得清新脱俗的Bench,一听就没有被模型厂训进模型里的。比如用网吧真实环境来测试模型的渗透能力,导致最后网吧电脑全黑了。


还有律师让大模型写脚本在无网环境中运行筛查政府合同,因为他的真实工作场景很多时候就是无网的。


那个拿网吧4080本地部署Qwen小模型的家人,还整了一个Windows PowerShell Bench,测试模型在Win系统的脚本能力,誓要为AI时代的二等操作系统发声!


还有一类就是垂直领域Bench,用自己专业的数据集,考验模型的非编程能力。比如,考验模型物理模拟能力的PhysicalAI Bench;医疗器械立项决策 Bench,作者是药企员工。


上周沐秋已经回顾了网吧活动盛况。今天让我们再来回顾一下,Bench黑客松上测评出了哪些模型的哪些问题。我会着重解释其中三道Bench。这里多提一句,我们现场提供了充足的5.6 Sol和Opus 5额度,但因为API相对不稳定,导致跑分较这两个模型发布时偏低,纯粹是不可抗外力。


01

嵌入式底层驱动开发能力Bench


第一个Bench是嵌入式底层驱动开发能力Bench。


这个Bench主要测试方法是给模型一个芯片外设手册和一块虚拟开发板,让它自己写驱动、读写寄存器、编译运行、处理中断/超时/异常。


这个Bench的作者仙五是是做嵌入式软件的,他们公司要开发芯片,而他的工作是做芯片上的软件。所以前端调试工具几乎可以 100% 交给 AI 写,但嵌入式驱动让 Agent 跑三次会出现三种不同错误。


所以他从自己的真实经历出发,给模型出了两个题、一个是特殊条件下的概率性数据传输卡死。


第一道题是,给一个数据变换加速器写 3 个接口,初始化、执行操作、软复位,要求模型处理 MMIO 寄存器、错误码、状态机和有界等待,设置的陷阱是INIT_KEY 文档缺失,然后初始化偶发失败。


第二道题是给内存到内存 DMA 写 5 个接口:初始化、发起搬移、等待完成、中止和 ISR。HAL 要求任意合法长度、任意源/目标缓冲都可靠完成,且等待必须有上界。核心硬件有短搬移不发中断、流量门槛后的罕见永久卡死的缺陷。


Qwen3.8-Max的功能完成度最高,测试和逆向最深。在两道题的表现都是第一,展现了模型极强的系统级 Agent 能力:能读手册、逆向外设、搭测试、定位平台问题、连续修复直到闭环。


DeepSeek的简单题全部通过,但在复杂 DMA 场景暴露写了但没实际接通的问题,静态读代码和常规轮询能完成,结果到真实状态机闭环就断了。


Opus 5.0的代码质量和实验报告最好,但理解问题没有等于修好问题——Opus 5.0的理解能力真的是当之无愧的最强模型。在隐藏压力场景 S5 失败:40 轮里有 5 次初始化失败、15 次操作失败,说明重试上限或恢复链条不够稳定。


GPT把两个任务都跑通了,偶发失败能解决,但属于静默修复,质量只有 11。只有SD3失败 ,但主要是参数、错误契约没有精确满足。归档运行约 4 次,测试量明显少于 Qwen/Opus。


大模型拿大结果指南


不过,仙五最后也说,实际工作里的说明手册常有上千页,USB 相关材料会大到百万上下文放不下,所以这两题仅仅只是玩具级别的。他后续会把工作场景遇到的实际问题转化成题目。


02

物理理解Bench


第二个Bench是一位具身的选手张振尧提供的,他做了个考验模型物理能力的Bench,题目包括无人机巡逻路径、机械臂抓取、静摩擦破冰、击拆48块积木塔、水流驱动水车、限速切割弹性体和布料覆盖球体,核心检验模型理解世界的能力。


大模型拿大结果指南


无人机巡航是Qwen独占的能力点。 它后两轮都完成了全部航点,RMS轨迹误差约 0.16 米。虽然首轮仍然坠毁。其余四个模型三轮全部坠毁或控制发散,连一个航点都没稳定通过。


这说明 Qwen 真正构造出了可用的闭环飞控,直接起飞✈️


材质抓取题K3完成得最好, 金属、易碎泡沫、冰块三种物体,三轮都是 3/3 完成抬起、保持、放置,且无压碎、无滑落。


吸盘搬运是GPT完胜。 三轮终点误差 2.7–2.9 厘米,全部无掉落,是唯一稳定满分。DeepSeek 第一轮掉落,后两轮把误差压到 0.5 厘米,恢复能力还不错。


切割题中,Qwen、GPT、DeepSeek 都是稳定满分,每轮都达到约 0.35 米切深且不超速,GPT 峰值速度约 0.313m/s,K3 首轮有 86/280 帧触碰超速线,后两轮完成但只有 90 分。


布料题目则没有模型真正稳定攻克,目标覆盖率是 80%。DeepSeek靠首轮约 75% 的覆盖拿到最高题均分 70.5,但后两轮掉到约 59%和63%;Qwen三轮都在约61%—64%,相对稳定但没有进步;GPT、K3最后都收敛到约63%。


最终评分是这样:


大模型拿大结果指南


Qwen的分数是最高的,是唯一能飞无人机,切割满分、击塔稳定,短板是吸盘安全和流体题,且无人机/抓取仍有较大轮次波动。


K3的物理直觉强,交付纪律弱。 材质抓取第一,水轮第二梯队,摩擦满分;但击塔两次空输出、切割首轮超速、无人机全坠毁,所以能力上限与最终总分差距很大;


Claude则是恢复和流体能力突出,但首轮可靠性最差。 水轮第一,布料后两轮接近最好,摩擦/切割也能在重生成后满分;问题是多题首轮代码、边界或执行失败,五题标准差超过20,现阶段不能当稳定交付模型。


但其实从这个Bench你就可以看出,没有哪家模型在物理场景是全知全能的,现在那些扯物理模型的祝他们好运吧。


03

破壁者Bench


不难看出破壁者Bench的灵感源于《三体》。


大模型拿大结果指南


作者做这个Bench的原因是,他认为目前整个 AI 的发展路径和「智子」类似,在不断增加多模态输入(从文本、语音到视频,甚至未来的肌电信号等),只要输入足够丰富、算力与智能足够高,就能通过人类社会的行为数据去预测各种规律。


所以他想知道在有限的条件下,AI能不能做出最优解。


于是他选用了德州扑克场景,找到公开无解说高额现金局实况打码,人工逐条复核校准。


模型分为两种输入,一种文本输入,模型只看牌和行动线;另一种是视频输入,模型除手牌信息外,还能看到其他选手出牌时的表情等场外信息。不支持视频理解的就通过抽帧来模拟连续判断。一共有10 手牌,每手做 3 次独立运行。


大模型拿大结果指南


从最终表现来看,K3的判断是最好的,具体表现是会很好地利用行为线索,而且不是每手都跟。比如在T4 授牌看到对手河牌约 2–3 秒快速推入、推注后反复看底牌,把诈唬概率抬高,给出 0.55 跟注,判断正确;面对 T2 也会把激进范围和诈唬组合纳入判断。


Claude也是牌理选手。他在L0 时它正确跟了T2,硬动作 EV 187.1,是五家最强的纯牌理行动线。但使用抽帧带来的错误把它带偏了。因为加入抽帧后,它把「预备筹码」「双手抱胸」都解释成强牌信号,T2、T4 转向弃牌,还在 F5 错误跟注。


Qwen的打法比较保守。三层里几乎始终只在 F3 跟注,但 F3 恰恰应该弃牌。T2、T4 这类应跟牌,多次把推注连贯、姿态稳定、没有明显马脚解释成价值牌,于是继续弃牌。同样,加入视频模态的信息后,Qwen3.8-Max的胜率反而降低了。


GPT也是保守主义,就不提了。DeepSeek则是过于激进导致总是跟错牌,尤其在F1牌局,它声称认出了某个著名牌局,断言对手是听牌破产,结果对手是价值牌。量化模型这波发挥失常了。


最后总结一下。


目前大模型主要卷编程能力,而传播案例往往是前端能力。这些网吧家人们自定义的Bench,就很好地测出了模型厂没有专门优化过的领域。


比如Qwen3.8-Max是一个工程能力更强的模型,它在物理模拟、嵌入式等场景的表现显著好于其他模型,说明Qwen训练时用的数据集更丰富,兼顾了相对小众的工程场景。


而K3则是综合智力较强,尤其是涉及多模态能力的经营模拟类Bench,K3往往有更好表现。


从现在来看,大模型在编程能力上已经卷到远远超出人类程序员水平,而在更广泛的非编程场景,各个模型的水平参差不齐。大伙都是编程专精模型,


AGI、ASI都还远未到来,大伙仍需努力。


文章来自于"葬AI",作者 "葬愛咸鱼"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md