AI资讯新闻榜单内容搜索-GPT-5.4

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: GPT-5.4
当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

Salesforce AI与UIUC研究人员提出Strong-to-Weak Scaffolding方法,让强模型(Builder AI)为弱模型GPT-5.4-mini自动设计外部Harness工作框架,无需修改参数即可将其在心智理论任务上的平均准确率从0.488提升至最佳0.912,揭示AI4AI的核心机制是将认知结构而非知识从强模型迁移至弱模型。

来自主题: AI技术研报
7893 点击    2026-08-31 15:26
刚刚!Claude Fable 5,又拿第一了

刚刚!Claude Fable 5,又拿第一了

刚刚!Claude Fable 5,又拿第一了

Claude这次,真把AI编程榜单打出断层了!就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。 排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。

来自主题: AI资讯
9095 点击    2026-08-04 12:24
AI权威清洗: 一张肉眼难辨的图片,就能让GPT-5.4、Claude Opus 4.6集体造谣

AI权威清洗: 一张肉眼难辨的图片,就能让GPT-5.4、Claude Opus 4.6集体造谣

AI权威清洗: 一张肉眼难辨的图片,就能让GPT-5.4、Claude Opus 4.6集体造谣

来自 ETH Zurich 的 Florian Tramèr 团队在最新论文中抛出了一个出乎意料的问题:如果 AI"看到" 的图,根本不是你肉眼看到的那张,会发生什么样的后果呢?他们把这种现象称作 AI 权威清洗(AI Authority Laundering)。

来自主题: AI技术研报
10063 点击    2026-05-31 11:27
国产万亿参数模型Ring-2.6-1T开源!养“龙虾”实力超GPT-5.4

国产万亿参数模型Ring-2.6-1T开源!养“龙虾”实力超GPT-5.4

国产万亿参数模型Ring-2.6-1T开源!养“龙虾”实力超GPT-5.4

今天,蚂蚁百灵开源旗舰级思考模型Ring-2.6-1T,该模型于5月9日发布,引入了可调节的Reasoning Effort机制,支持high与xhigh两种推理强度,开发者可以根据任务特性动态分配推理资源。

来自主题: AI资讯
11073 点击    2026-05-15 19:55
token级,精准控制生成长度:3B模型击败GPT 5.4、Claude

token级,精准控制生成长度:3B模型击败GPT 5.4、Claude

token级,精准控制生成长度:3B模型击败GPT 5.4、Claude

LenVM将长度建模提升到token级别,开辟可扩展价值预训练的新维度——3B开源模型精确长度控制全面击败GPT-5.4、Claude-Opus-4-6等顶级闭源模型;相同token预算下推理准确率提升10倍(63% vs 6%);沿模型规模、数据量、采样数三轴无饱和scaling的value pretraining

来自主题: AI技术研报
6851 点击    2026-05-08 14:06
3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

一个3B激活参数的端侧模型,在全球Agent权威评测中,以94%任务完成率,超越了Claude、GPT-5.4、Gemini等国际主流云侧和端侧大模型。商汤绝影Sage来了,它不是「更聪明的语音助手「,而是第一个真正能在车里「办成复杂事「的智能体基座。

来自主题: AI资讯
9358 点击    2026-04-22 18:52
实测OpenRouter黑马模型,批量任务秒级响应,成本只有GPT-5.4-mini的1/10

实测OpenRouter黑马模型,批量任务秒级响应,成本只有GPT-5.4-mini的1/10

实测OpenRouter黑马模型,批量任务秒级响应,成本只有GPT-5.4-mini的1/10

用AI跑批量任务的人,手里基本都有一个干活的模型,不是最聪明,但要快、要便宜,稳定不出岔子。

来自主题: AI产品测评
8276 点击    2026-04-22 16:36
OpenAI祭出GPT-5.4神装!Codex同款Harness全面开放

OpenAI祭出GPT-5.4神装!Codex同款Harness全面开放

OpenAI祭出GPT-5.4神装!Codex同款Harness全面开放

就在刚刚,Agents SDK迎来一次彻底的架构重写。原生harness、原生沙盒、Codex级的文件系统工具,外加七家头部沙盒厂商一键接入。3月初,GPT-5.4带着原生computer use(计算机使用)高调登场时,开发者就已经吐槽过一件事。

来自主题: AI资讯
9748 点击    2026-04-16 20:39
OpenAI也搞「Mythos」?刚刚,网络安全版GPT-5.4-Cyber亮相

OpenAI也搞「Mythos」?刚刚,网络安全版GPT-5.4-Cyber亮相

OpenAI也搞「Mythos」?刚刚,网络安全版GPT-5.4-Cyber亮相

没放出大家伙心心念念的 GPT-5.5 或 GPT-6,OpenAI 刚刚发布了全新的、强调网络安全版本的「GPT-5.4-Cyber」。

来自主题: AI资讯
10631 点击    2026-04-15 10:09