苹果新作:内化视觉思考,推理提速 5 倍
苹果新作:内化视觉思考,推理提速 5 倍苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
搜索
苹果研究团队提出 Internalized Visual Thinking(IVT)后训练框架,通过在训练阶段联合学习文本答案与未来帧隐空间表征、在推理阶段完全移除未来视觉预测过程,使模型在主动视频推理任务上相比 Visual CoT 获得超过 5 倍的推理加速,且在六项评测设置中均优于 Answer-Only SFT。
OpenAI……又解散了一个安全团队。
今天,一条前两天的推文开始热传,内容只有 5 个词:Scott Gray 已离开 OpenAI。
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
7月22日,美国佛罗里达州的牧师 Scott Winters,在旧金山把 OpenAI 和它的 CEO Sam Altman 告了。Winters 称自己在 2025 年夏天身体开始不对劲,症状持续有六个星期,这期间他没往医院跑,而是一遍遍去问 ChatGPT-4o 。可他后来才知道,那些被他反复描述的症状,其实是肺栓塞的征兆。血块堵在肺部血管里,随时会要命。
过去一年,AI 推理模型的使用成本让不少开发者叫苦。
这不是科幻小说,而是 METR(模型评估与训练研究组织)联合Anthropic、Google、Meta和OpenAI 进行内部红队测试后,发布的首份《前沿风险报告》中披露的真实案例。这是四大巨头第一次允许第三方深入测试他们内部最强、可访问完整思维链(CoT)的模型,并开放非公开的对齐与控制信息。
近年来,Chain-of-Thought(CoT)推理已经成为提升大语言模型和多模态大语言模型复杂问题求解能力的重要技术路径。
在 AI 音乐行业,有一个正在悄悄发生的迁移。
GitButler最近发布的CLI工具引起了我很大的兴趣。这不是一个简单的Git包装器,而是从根本上重新思考了命令行工具应该如何设计。Scott提到了一个有趣的观察:大约80%的开发者仍然使用命令行工具来操作Git,即使有各种GUI工具存在。