群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施
群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施去哪训练、拿什么学、怎么考?这是物理AI从实验室走向现实世界的三个核心问题,现在有了系统性答案。
搜索
去哪训练、拿什么学、怎么考?这是物理AI从实验室走向现实世界的三个核心问题,现在有了系统性答案。
OpenAI首次公开下一代模型Astra(被传为GPT-6)的网络安全能力,其在ExploitBench漏洞利用基准上达到100%成功率,内部测试中网络安全能力约为GPT-5.6 Sol的4倍,并能自主发现并利用零日漏洞,OpenAI通过安全训练和"蜜罐"测试等双闸门防范滥用与模型失控,浙大校友漆翔宇和同济校友Jiawei Liu深度参与了Astra研发。
今天的视频生成模型,已经越来越像一个会拍电影的导演。
科研的链条很长。文献读不完,方向想不清,实验一轮接一轮,论文改到深夜。过去两年,大模型已经能读论文、写代码、改文章,但它们大多以问答工具的形态散落在各个环节,替研究者节省的只是零碎时间。
图像生成模型正从「会创作」转向「可操作」。
近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。
浙江大学、清华大学智能产业研究院、影溯 InSpatio、RoboParty Lab 等团队提出的 INTACT(INtent-To-ACTion),一种基于端到端 JEPA 的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划
交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
浙江大学计算机辅助设计与图形系统全国重点实验室杜鹏团队提出了一个支持多模态输入的CAD建模智能体:CADDesigner。该智能体致力于构建一个中间层,将大模型、智能体与传统几何引擎深度融合,帮助CAD设计师提升模型设计能力和生产效率。
来自浙江大学 APRIL 实验室、快手主站技术部和清华大学的研究团队提出了 MobileForge,试图把手机 GUI Agent 的适配过程变成一个 “无标注、自探索、自反馈、自优化” 的闭环系统。