迪士尼物理AI版图曝光,它挑中了这两家公司
迪士尼物理AI版图曝光,它挑中了这两家公司2026 年 7 月 31 日,迪士尼公司公布了旗下加速器项目(Disney Accelerator)第 12 期名单,入选的 5 家公司都和 AI 密切相关,其中包括具身智能公司 FieldAI、Physical Intelligence(简称 PI),以及 3 家生成式 AI 公司。
搜索
2026 年 7 月 31 日,迪士尼公司公布了旗下加速器项目(Disney Accelerator)第 12 期名单,入选的 5 家公司都和 AI 密切相关,其中包括具身智能公司 FieldAI、Physical Intelligence(简称 PI),以及 3 家生成式 AI 公司。
近日,比特无限发布的 Arko-T,是一款面向 Text-to-Structured 3D Generation 的 4B 参数基础模型。该模型由比特无限联创、首席科学家周平义博士带队完成。它接收自然语言描述,直接输出可执行的 Build123d 程序。程序经过 CAD 内核运行后,可以得到带有命名参数、结构特征和建模过程的 CAD 设计实体。
7月6日,比特币矿企TeraWulf与Anthropic签下一份为期20年的数据中心租约,合同总价值约190亿美元。两周后,另一家矿企Hut 8又公布了一份价值98亿美元的长期租约,它在得州建一座AI数据中心,把其中352MW的机房和电力容量租给一家未公开的大客户,租期15年,总租金约98亿美元。
交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
阿里巴巴达摩院的最新工作RynnWorld-Teleop对此给出的方案是:用生成式世界模型替代真实机器人。操作员的手势驱动一个实时视频生成器,由“数字世界中的机器人”完成全部视觉演示,同时自动获得关节级的动作标签。该方案被称为数字遥操作(Digital Teleoperation)。
最近,一篇名为 FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining 的工作引起了不少关注。换句话说,FreeStyle 研究的是 style-content dual-reference generation,也就是「内容 - 风格双参考生成」。
近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi、SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。
如果想开发一个视频理解应用,你会怎么做?
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
General Intuition 做的事听起来有点绕:用游戏数据训练现实世界里的 AI Agent。换成更直白的话说,General Intuition 做的是让 AI 先在游戏里学会“怎么行动”,再把这种能力迁移到机器人、无人机、自动驾驶、仿真环境里。