AI资讯新闻榜单内容搜索-Arena

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Arena
世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

世界模型迎来「真考场」:WorldArena 2.0 Challenge正式启动

WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。

来自主题: AI技术研报
9645 点击    2026-07-16 10:10
Reve 2.1 发布:在 Arena 文本到图像排行榜上排第二,训练算力仅为竞品十分之一

Reve 2.1 发布:在 Arena 文本到图像排行榜上排第二,训练算力仅为竞品十分之一

Reve 2.1 发布:在 Arena 文本到图像排行榜上排第二,训练算力仅为竞品十分之一

Reve 在 7 月 9 日把图像模型迭代到了 2.1 版。距离 2.0 发布刚好一个月,放在基础模型圈子这不算常见。前面只挡着一个 OpenAI 的 GPT Image 2。另外官方说:「训练这版模型用的算力不到排行榜前后邻居的十分之一」。

来自主题: AI资讯
8756 点击    2026-07-14 11:56
1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

Fable 5重新上线,Arena.ai的Gostev在一段视频中甩出63个3D世界,几乎都是一次成型。看了视频,就连刚加盟Anthropic预训练团队的Karpathy,也直呼没想到。

来自主题: AI资讯
9010 点击    2026-07-06 15:52
中科院工业人工智能研究所世界模型PAIWorld登顶WorldArena榜单!

中科院工业人工智能研究所世界模型PAIWorld登顶WorldArena榜单!

中科院工业人工智能研究所世界模型PAIWorld登顶WorldArena榜单!

日前,世界模型国际权威榜单 WorldArena 更新排名,中国科学院工业人工智能研究所徐凯研究员带领物理智能团队(The PAI Lab)自研的世界模型 PAIWorld 登顶。WorldArena 作为目前世界模型领域最权威的评测榜单,是针对具身世界模型的全方位评价体系,涵盖视觉质量、运动质量、内容一致性、物理遵循、三维准确性及可控性六大维度

来自主题: AI资讯
9227 点击    2026-06-22 11:33
PEFT方法评测不能只看下游分:通用能力损失也该被量化

PEFT方法评测不能只看下游分:通用能力损失也该被量化

PEFT方法评测不能只看下游分:通用能力损失也该被量化

近期,来自香港中文大学、西湖大学、德国马普所等机构的研究者提出了 PEFT-Arena —— 一个从稳定性‑可塑性权衡(stability–plasticity trade-off)视角重新审视 PEFT 方法的评测基准与分析框架。该工作已在 ICLR 2026 相关 workshop 上进行了展示,并开源了完整代码。

来自主题: AI技术研报
10522 点击    2026-06-14 10:38
神话级Claude 5,登顶了!

神话级Claude 5,登顶了!

神话级Claude 5,登顶了!

发布24小时,神话级Claude 5光速登顶!不仅创下AI史上最大分差纪录,更将GPT-5.5直接斩落马下。

来自主题: AI资讯
16025 点击    2026-06-11 15:26
37万次真实会话实测Agent榜单:GPT-5.5High第一,Claude最稳,真实干活能力看这五项核心指标

37万次真实会话实测Agent榜单:GPT-5.5High第一,Claude最稳,真实干活能力看这五项核心指标

37万次真实会话实测Agent榜单:GPT-5.5High第一,Claude最稳,真实干活能力看这五项核心指标

6月4日,Arena.ai发布Agent Arena排行榜,用373,431次真实会话的数据,给18个主流模型的Agent能力排了个座次。先看总榜。Agent Arena的排名依据是“净改进”(Net Improvement),用因果推断方法算出每个模型相对于随机基线的性能提升幅度。正值代表比随机选择更好,负值说明不如随机。

来自主题: AI技术研报
11033 点击    2026-06-07 14:38
老黄的Cosmos 3刚发一天,就被一家中国公司反超了

老黄的Cosmos 3刚发一天,就被一家中国公司反超了

老黄的Cosmos 3刚发一天,就被一家中国公司反超了

6 月 1 日,老黄在 GTC 上用了不小的篇幅讲物理 AI 和具身智能,并重磅发布了 Cosmos 3。英伟达将其定义为面向 Physical AI 的最新前沿模型,也是全球首个完全开放的全能模型,原生具备视觉推理、世界生成和动作生成能力。

来自主题: AI资讯
9722 点击    2026-06-04 09:15
世界模型榜首易主!跨维智能登顶WorldArena

世界模型榜首易主!跨维智能登顶WorldArena

世界模型榜首易主!跨维智能登顶WorldArena

近日,全球具身世界模型权威评测基准 WorldArena 公布最新榜单。在 5 月 25 日截止的最终榜单中,跨维智能登顶 Track 2 赛道全球第一。可以说是,在英伟达、谷歌等全球科技巨头深度布局、重兵把守的世界模型核心腹地,跨维智能实现了强势突围。

来自主题: AI资讯
9744 点击    2026-06-03 15:27