全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型
全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型近日,Anthropic官方发了一篇长文专门来讲这件事。 起因是太多人把Claude Code里的两个选项搞混了:一个是模型选择(Model),一个是努力度(Effort)。过去,大家对这两个选项的理解都很简单:换更大的模型,AI就更聪明;把Effort调高,无非是让AI多想一会儿。
搜索
近日,Anthropic官方发了一篇长文专门来讲这件事。 起因是太多人把Claude Code里的两个选项搞混了:一个是模型选择(Model),一个是努力度(Effort)。过去,大家对这两个选项的理解都很简单:换更大的模型,AI就更聪明;把Effort调高,无非是让AI多想一会儿。
测试方法很简单。 找一个创意性极强的项目,让 4 个模型从零搭建,然后逐个跑一遍,看看谁做得最好看、谁最完整、谁翻车最惨。项目选的是一个 3D 浮岛创意作品集,对标 jordan-breton.com 那种风格,一座漂浮在空中的岛屿,上面有自然元素,随着页面滚动镜头会环绕岛屿移动,分成远景、中景、近景、拉远四个章节。
为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是
量子位不完全统计了97家国内具身数据玩家的情况,其中70家做数据采集,27家做数据infra。过去一年(2025年7月1日至2026年7月1日),15家「不做本体、不做模型、只做数据的独立具身数据服务商」,共融资约44.7亿元。
GraphPlanner通过引入图记忆网络,将多智能体LLM的路由过程升级为动态工作流生成。不仅选择调用哪个模型,还决定每个模型应承担的角色,实现任务分解与协作规划。
来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?
我们汇总了两篇文章的要点,想要讲清楚几件事:到底什么是世界模型?什么不是?当下的竞争格局:世界模型将走向何方,哪条路线可能胜出?所有路线都会撞上的那堵墙是什么,有哪些可能的解法?
微软Copilot & Agents Core总裁Nitin Agrawal说,「迫不及待想让客户看到GPT-5.6能做什么」——不管是起草文档、分析数据、做演示,还是跨团队协作,产出都会更精致。除了原生接入模型,微软还会直接通过OpenAI API调用GPT-5.6,服务Microsoft 365客户。双通道,齐上阵。
今天上午,上海AI大模型企业MiniMax发布公告,拟通过配售新股及发行可转换债券募集资金约160亿港元(约合人民币138.34亿元)。与此同时,MiniMax创始人兼CEO闫俊杰发布内部信称,在实现AGI之前将不再从该公司领取薪酬,并将个人持有相当于MiniMax总股本5%的股份用于员工激励以及支持开源社区发展。
7 月 9 日,OpenAI 一口气发了三样东西,新模型 GPT-5.6,一个把 Chat、Work、Codex 装进同一个壳的新桌面应用,以及本文的主角 ChatGPT Work。官方的说法是,ChatGPT 从此不再只是回答问题,而是把活真正干完,交出来的不是聊天记录,是表格、文档、PPT,甚至一个能直接分享的网站。