AI资讯新闻榜单内容搜索-DIT

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: DIT
视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。

来自主题: AI技术研报
8488 点击    2026-08-24 08:49
突发,GPT-5.6 Sol大降价!OpenAI把价格战烧到旗舰

突发,GPT-5.6 Sol大降价!OpenAI把价格战烧到旗舰

突发,GPT-5.6 Sol大降价!OpenAI把价格战烧到旗舰

突发,GPT-5.6 Sol 开启大幅降价!未来三个月,API 价格和 credit 价格(超出计划包含额度后的按需付费用量)一起砍掉超过20%。目前,API 端已经即时生效,符合条件的 ChatGPT Work 和 Codex credits 正在陆续推送。

来自主题: AI资讯
9546 点击    2026-08-22 14:28
不靠 CFG、DMD、GAN、Drifting 和MeanFlow,如何训练一步生成模型?

不靠 CFG、DMD、GAN、Drifting 和MeanFlow,如何训练一步生成模型?

不靠 CFG、DMD、GAN、Drifting 和MeanFlow,如何训练一步生成模型?

只做一次生成器前向,就能得到一张图,这是一步生成追求的效率。但想把采样步数降到 1,难题其实在训练端:怎样用足够稳定、简单的监督信号,让生成分布靠近真实分布?

来自主题: AI技术研报
10523 点击    2026-08-10 09:51
MiniMax H3 团队 Reddit 上回应一切:2K 要开源,图像模型在路上,Apache 2.0 也在考虑了

MiniMax H3 团队 Reddit 上回应一切:2K 要开源,图像模型在路上,Apache 2.0 也在考虑了

MiniMax H3 团队 Reddit 上回应一切:2K 要开源,图像模型在路上,Apache 2.0 也在考虑了

8 月 7 日晚上 10 点,MiniMax H3 团队来到 Reddit 的 r/StableDiffusion 社区举行 AMA(Ask Me Anything)。参与此次交流的包括 H3 研究负责人 dacongya,研究员 Luigi、Nero、Kiro,系统工程师 Reynor,以及 MiniMax 开发者关系负责人 Ryanlee。

来自主题: AI资讯
9919 点击    2026-08-08 19:36
实时视频版「Nano Banana」来了!京东开源160亿参数AI视频模型JoyAI-Video-Edit

实时视频版「Nano Banana」来了!京东开源160亿参数AI视频模型JoyAI-Video-Edit

实时视频版「Nano Banana」来了!京东开源160亿参数AI视频模型JoyAI-Video-Edit

新智元报道 这个 8 月,AI 视频赛道的军备竞赛又升级了。 字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗

来自主题: AI资讯
10306 点击    2026-08-07 13:54
A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

A²-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。

来自主题: AI技术研报
7116 点击    2026-08-01 10:44
ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

ECCV2026|4步去噪实现12.66 FPS,清华、港科大提出实时流式视频编辑框架LiveEdit

近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。

来自主题: AI技术研报
7954 点击    2026-08-01 10:44
神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

神秘黑马-莫刻机器人冲榜WorldArena,仅32张真武810E封神

机器人实验室里,这样的画面总是反复出现:屏幕上模拟的机械臂正以完美轨迹移动,但真实世界的一边,玻璃杯还待在桌面上,甚至已被夹爪打翻。

来自主题: AI技术研报
8854 点击    2026-07-30 16:56