世界模型的三维难题新思路:原生一体生成左右眼完整视频流
世界模型的三维难题新思路:原生一体生成左右眼完整视频流VAST,香港大学和PICO开源了一个双目世界模型——StereoWorld。
搜索
VAST,香港大学和PICO开源了一个双目世界模型——StereoWorld。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
根据雷锋网报道,快手可灵AI核心技术骨干王鑫涛已确认离职。有知情人士透露,其下一站大概率将前往另一家头部互联网大厂。公开资料显示,王鑫涛本科毕业于浙江大学,博士阶段进入香港中文大学多媒体实验室深造,师从汤晓鸥教授,长期深耕计算机视觉与生成式AI方向。
近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。
Personal Agent OS 公司「Tiiny AI」宣布完成数千万美元天使轮系列融资,由顺为资本、经纬创投、锦秋基金、云启资本、戈壁—阿里巴巴香港创业者基金、BV 百度风投、光源 L2F 基金联合投资。光源资本担任孵化方和独家财务顾问。
EvoMap 创始人张昊阳在 WAIC 行业圆桌现场与香港大学 HKUDS 黄超教授同台,并当场就 OpenSpace 项目零成果归属的问题提出质疑,他后续发布动态表示,黄超面对提问时言辞躲闪、神色局促,这一幕也被不少行业从业者称作本届 WAIC 最受关注的对峙场面。
为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是
最近,来自新加坡国立大学、香港中文大学 MMLab、北京大学和京东探索研究院的研究团队提出了一种全新的在线策略蒸馏方法: DOPD (Dual On-policy Distillation) ,通过优势感知的双重蒸馏范式,成功破解了这一难题。
手术 AI 正在从 “单帧感知” 迈向 “全流程视频理解” 的全新时代!近日,由中国科学院香港创新研究院人工智能与机器人创新中心领衔,发布了全球首个十亿级参数、最大规模数据集练成的手术视频原生基础模型 ——SurgMotion!
华源智因近期完成数千万元种子轮融资,由水木创投领投,向阳资本于本轮后担任长期独家财务顾问。公司创始人杜润诗就读于加州大学洛杉矶分校(University of California, Los Angeles),主修计算机科学与经济学,大四决定辍学创业;CTO王艺璇为香港中文大学计算机系博士生,师从李煜教授,已发表10余篇论文