Claude满分、GPT 99分!何恺明团队把AGI考试打穿了
Claude满分、GPT 99分!何恺明团队把AGI考试打穿了何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
搜索
何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
东南大学魏秀参团队提出LeaP(Learnable source Prior)方法,由本体感知信息驱动并联合预测动作生成起点的均值与方差,在RoboTwin仿真15项任务上平均成功率81.6%、较标准高斯基线提升25.5个百分点,相关论文已被CoRL 2026接收。
南洋理工大学安波团队最新研究指出,Agent Harness的选型应将模型、Harness与任务作为完整配置联合评估,不同任务下最佳组合会变化,原生搭配也未必优于其他可配置Harness。
毕树超领衔的Meta超级智能实验室官宣,其Muse Spark模型在6个月内协助数学家连破概率论、微分方程、群论、优化理论、算术物理学及非结合代数六大领域的开放性难题,其中5篇论文直接给出前沿问题答案并推翻了既有群论规则,被毕树超称为数学界的"AlphaGo时刻"。
谁说 DeepSeek 假期不加班?就在昨天,DeepSeek Harness 又更新了。 这次发布的 v0.2.1-alpha.1,新增了一项很惹眼的功能:实验性 Claude Code Mods 兼容层。更有意思的是官方对它的解释:这次首先想验证,Claude Code Mods API 的能力,大致属于 DeepSeek Harness 插件能力的一个子集。
论文DepthART提出抗偏置数据采样与相机条件化微调方法,将基础单目深度估计模型压缩至约6M参数,在保留跨场景泛化能力的前提下实现Jetson等端侧设备的高帧率部署。
a16z最新90页报告《STATE OF MARKETS》指出,Alphabet、亚马逊、Meta、微软和甲骨文五家科技巨头2026年合计资本开支预计接近7770亿美元,AI建设正成为影响宏观经济的重要变量,供应链获得订单但回报兑现仍有先后,软件行业则进入"证明自己"的阶段。
Anthropic CEO Dario Amodei的妻子Cami Clark——被称为公司「第一夫人」——在Anthropic冲刺最高2万亿美元IPO前夕悄然退出,被视为公司从创始人非正式权力圈向制度化治理转型的关键信号。
Opus5.5已经这么牛了,Fable5.5得啥样?超人在5000年以来每个时代的画作中穿梭,到哪个画框就换成相应的美术风格。这个作品其实不只是视频,而且是发布在Claude官网的Artifact网页,可以任意拖动进度条,原速播放的话甚至有点卡。
《大西洋月刊》长文披露,2020年Dario Amodei因与Sam Altman在AGI计划、GPT-3客户名单、微软投资及安全团队否决权等问题上矛盾激化,带领7名核心成员从OpenAI离职并创立Anthropic,使其从最初规划的50人安全实验室成长为OpenAI最强竞争对手。