ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事
ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。
搜索
过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。
过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。
在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。
大语言模型,现在真的长出手了。 本周四,Anthropic 宣布推出硬件用 MCP:Model Hardware Standard(MHS),这是一项新标准,用于帮助所有大模型驱动的 AI 智能体(Agent)安全快捷地操纵物理设备。
几个小时前,Barret Zoph 在 𝕏 上发了一条推文,他说自己将加入谷歌 DeepMind,而他的 AI 生涯正是从谷歌 Brain 的 Residency 项目起步的,这次算是重返旧地;他将专注于强化学习(RL)与后训练(Post-Training)方向,更多消息稍后公布;他还补了一句,谷歌拥有在 AI 领域持续成功所需要的全部要素,他很高兴能成为这个使命的一部分。
OpenAI 刚刚发布的官方博客和数十页技术报告中将其定性为一声「警钟」(warning shot)。同时,第三方机构 METR 和 Redwood Research 发布了独立调查报告。OpenAI 的 Noam Brown 提醒,驱动这次事件的模型与 GPT-5.6 Sol 同等规模,下一代模型能力会更强。
这几天 ox-alpha 用爽了吧...正如很多人猜的那样,这个模型来自智谱,正式名称为 glm-5.3-flash,支持多模态,但很多人没猜到的是:这个乱杀的模型只有 321B,且与 glm-5.3 不同,是完全的新架构
Claude Code 又更新了一个颇有意思的小功能。 这一次,它可以帮你起草反馈报告了。 当某个功能出现故障、Claude 发现自己犯了错误,或者你告诉它哪里出了问题时,它会自动把相关情况整理成一份报告。
今天,全新 Qoder 正式发布!这是一个以 Coding 能力为核心底座,面向所有人打造的智能体工作台。告诉 Qoder 你想完成什么,它会理解上下文、制定计划、调用工具、执行并验证。整个过程随时可以查看、调整或接管。