AI资讯新闻榜单内容搜索-模型

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

SWE-Bench上能拿72%的模型,换张考卷直接归零!Meta联合斯坦福、哈佛放出ProgramBench,200个项目从零手写,9大顶级模型完整通过率0%。最强的Claude Opus 4.7平均通过率也才51.2%。更离谱的是一联网,就有模型在36%的任务里跑去GitHub扒源码。

来自主题: AI技术研报
6858 点击    2026-05-07 12:03
号称1200万token上下文的模型来了,数据亮眼但疑点重重

号称1200万token上下文的模型来了,数据亮眼但疑点重重

号称1200万token上下文的模型来了,数据亮眼但疑点重重

当地时间 5 月 5 日,迈阿密一家名为 Subquadratic 的公司走出隐身模式。CTO Alexander Whedon 在 X 上把首款模型 SubQ 称作“a major breakthrough in LLM intelligence”(LLM 智能领域的重大突破),

来自主题: AI资讯
7663 点击    2026-05-07 12:02
马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI

马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI

马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI

当OpenAI 还在抢模型话语权时,马斯克已经一手把 xAI 变成「算力包租公」,一手 Tesla AI5、AI6 与 Dojo 芯片——这个男人的AI帝国,永远比你想象的更疯狂。

来自主题: AI资讯
8733 点击    2026-05-07 11:02
OpenAI 选中的 37 名「超级大学生」,厉害在哪?做了什么?

OpenAI 选中的 37 名「超级大学生」,厉害在哪?做了什么?

OpenAI 选中的 37 名「超级大学生」,厉害在哪?做了什么?

OpenAI 揭晓了 ChatGPT Futures 项目,为 37 名年轻人提供了 1 万美元的无偿资助、前沿模型访问权限,并邀请他们 6 月去总部参访

来自主题: AI资讯
6731 点击    2026-05-07 11:02
13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%

13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%

13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%

Transformer统治地位悬了!一款SubQ模型带着SAA架构横空出世,1200万上下文成本仅Opus的5%,计算量暴减千倍。

来自主题: AI资讯
10257 点击    2026-05-07 10:59
本地4B开源模型,把任何App当Skill用!告别token焦虑,私密性强~

本地4B开源模型,把任何App当Skill用!告别token焦虑,私密性强~

本地4B开源模型,把任何App当Skill用!告别token焦虑,私密性强~

上次给大家分享了一个 CUA 的开源项目,能让 AI Agent 直接操控电脑界面,相当于把任何 App 都变成 Agent 的 Skill。反响还不错。

来自主题: AI技术研报
7618 点击    2026-05-07 10:18
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

大模型时代的「炼金术师」们,或许都曾面临一个共同的困扰:当我们试图将 DeepSeek-R1、OpenAI-o1 那种惊艳的推理能力迁移到小规模语言模型(SLMs)时,效果却总是差强人意。现有的强化学习方法如 GRPO 在 7B+ 的大模型上效果显著,但一旦应用到 1.7B 甚至更小参数的模型上,性能提升就微乎其微。

来自主题: AI技术研报
8979 点击    2026-05-07 10:16
蔡浩宇美国公司换血背后:裁撤大模型团队,押注超级智能体

蔡浩宇美国公司换血背后:裁撤大模型团队,押注超级智能体

蔡浩宇美国公司换血背后:裁撤大模型团队,押注超级智能体

在对多位内部开发者的采访中得知,这个模型的研发已被叫停。LPM 1.0 并非仍在推进的核心项目,而是视频团队对过去一年工作成果的集中汇报——既是对外展示,也是对内总结。该视频团队由“童姥”( 前微软亚研院首席研究员童欣) 带领, AilingZeng做Tech Lead,作者中近半数来自 Anuttacon内部,蔡浩宇本人并未直接参与模型研发。

来自主题: AI资讯
9359 点击    2026-05-07 01:20