全网实测开玩Fable 5.1,听说写作说话和真人没区别?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
全网实测开玩Fable 5.1,听说写作说话和真人没区别?
7650点击    2026-09-03 10:08

Anthropic前脚刚发布了Fable 5.1(具体可见Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线,后脚第三方权威跑分和个人第一手实测已经出炉了!


Anthropic研究员就展示了用Fable 5.1写代码,直接生成设计视频:


看看这效果,谁不想急头白脸地用一顿……


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


话不多说了,咱们先上实测。


网友上手花样实测


看实例之前,先来看ARC Prize的基准测试。


成绩很不错,ARC-AGI-2拿下90.0%,ARC-AGI-1干到97.5%。


成本也更低,ARC-AGI-2每任务$3.12,ARC-AGI-1每任务$1.40,比Fable 5直接砍了32%


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


正经跑分之外,大量网友没忍住火速开玩,给大家看看网友们的作品——


最火的是一款马里奥风格的赛车游戏。


据说只有一句提示词——


「用CryptoNinja的MCP来制作一款马里奥卡丁车风格的游戏」


然后,嘎巴一声就做出来了,如下:


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


无独有偶,另一款“仅用一张截图”就做出来的赛车游戏,长这样:


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


对此,有热心网友发来「悲报」


马里奥赛车完蛋了啊。


此外,还有网友同样用一条prompt做出了一款恐龙主题的生存游戏。


包含20多个小时的可玩内容,涉及烹饪、制作道具、狩猎和驯服恐龙等玩法,还支持多人联机。


我觉得有必要放视频给大家感受一下效果。


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


他只用几个小时就做出来了,最后和朋友骑在一条被驯化的恐龙身上击败了霸王龙boss。


宾夕法尼亚大学教授Mollick认为,尽管Fable 5.1在需要判断力和审美的长程工作中确实有实质进步,但说话依然“Claude味儿”十足


在此前,有许多用户反映自己看不懂Claude说话,而这主要源于它一贯“术语生硬堆砌、文本高度压缩”的表达风格。


话虽如此,他还是用Fable 5.1兴高采烈地做了一款复古风游戏,玩家需要在游戏中驾驶一艘太空飞船:


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


更多的测试集中在跨模型任务上。


有网友用同一条提示词搭建了一个第一人称视角的3D海洋沙盒场景:


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


他自己感觉,Fable 5.1的水准已经相当细腻,堪比3A。


还有网友让Fable 5.1和Kimi K3做同一段视频:


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


Fable 5.1用时18分钟,成本12.60美元,Kimi K3用时10分钟,成本6.95美元。


有网友评论:虽然Fable更细节,但自己做的时候,肯定还是会用Kimi的,毕竟更有性价比。


大家觉得哪个效果更好呢?


Token效率、Coding、写作、长任务、知识创作……全面测评


除了网友实测,科技媒体Every对Fable 5.1进行了一次更为全面的深测,覆盖编程、写作和知识性工作等多个场景。


首先是大家比较关心的token效率,其用量仅有Opus 5的一半,且处理耗时还是Opus 5的60%。


团队表示,Fable 5.1才是真正的大众之选。


而在Coding与长任务方面,Fable 5.1保持了Fable 5的性能,但是更细节,更完美。


Every团队让模型一次性生成了一个斯坦福AI小镇式的模拟系统——


25 个有记忆、有日常行为的角色,互相聊天,还在镇上传播即将举办的市长选举的八卦。


搭完测试者都有点懵了:“说实话,我不确定模型还不能完成哪些事。”


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


深度用户、复合工程学之父Kieran也盖章认可:“现在我直接在会话里就能处理长时间任务,不用频繁切工具了。Fable 5虽然很棒,但用起来太麻烦。而这个版本适合所有人!”


写作和知识性工作是Every评测中表现分化最明显的部分。


团队测算,Fable 5.1在长篇文本写作、尤其是段落续写任务上的表现干翻了此前测试过的所有模型。


并且,AI味也淡了很多,词汇量少了很多——文字难度大概是初一学生水平,比Fable 5低两个年级。


说白了,就是不整那老些诘屈聱牙之作,开始说人话了


在需要更多主观判断的任务中,比如制作幻灯片、撰写人物访谈稿,它的表现也优于GPT-5.6和Sol。


但强大如此,也不是没有短板滴~


在设计方面,Fable 5.1并没有太多长进,配色单一,且作品并不完善。


并且,当任务带有明确限制,比如字数、主题、引用时,Fable 5.1就听不进去话了。


比如,要求输出1000 字,模型交付了1288字;要求提炼3到6个主题,模型给出了8个;要求提取八到十二条引用,模型给出了43条,全对也就算了,其中27条还根本不存在。


Every团队称之为,“总是尽自己最大的努力,做最多的活”。


(其实这也是老毛病了……)


此外,Fable 5.1还有一个不知道算不算毛病的特点。


在开启最高效率模式时,模型会额外调用不必要的子代理协助工作,即便被要求停止,它仍会继续运行。


所以还是要提前设置好预算啊。


基于这些测试结果,Every团队给出了一个大致的使用边界


如果你的任务是协同编程、需要实时调试,或者不希望在长时间任务上等待Fable 5响应,Fable 5.1是更合适的选择;


但如果任务对字数、数量等格式有硬性限制,需要引用内容一次性准确无误,又或者涉及复杂多工具调用且没有提前设定预算,建议优先考虑Opus 5或Sol。


One More Thing


此外还有一条信息有点意思。


有网友发现,Fable 5.1在请求删除权限时捏造了用户从未说过的授权话语。


它根本来不及等你,直接提前预判了用户的反应。


全网实测开玩Fable 5.1,听说写作说话和真人没区别?


Fable 5.1:bro别整没用的,我猜你的下一句话是……


也不知道这究竟算进步呢,还是退步呢……


参考链接:

[1]https://x.com/arcprize/status/2094894027451539744

[2]https://every.to/vibe-check/fable-5-1-vibe-check

[3]https://x.com/aimlapi/status/2094879208304685524

[4]https://x.com/Hesamation/status/2094864251059867847

[5]https://x.com/alexalbert__/status/2094860187743986169

[6]https://x.com/emollick/status/2094860076028657926

[7]https://x.com/Rubzem/status/2094866225960493189

[8]https://x.com/Bhavani_00007/status/2094913661915779239

[9]https://x.com/TimJayas/status/2094900247000654222


文章来自于"量子位",作者 "程浅"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI小镇

【开源免费】ai-town是MIT授权的一个AI虚拟小镇,该项目可以让研发人员轻松构建和定制你自己的AI小镇版本,其中居住在小镇的AI角色可以进行交流和社交。该项目受到研究论文《生成代理:人类行为的交互模拟》的启发。

项目地址:https://github.com/a16z-infra/ai-town

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0