AI资讯新闻榜单内容搜索-模型推理

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型推理
英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的

英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的

英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的

最近,英伟达发了篇官方的大模型推理指南,结果翻着翻着,硬是让人看成了一本华人团队的论文合集。

来自主题: AI技术研报
9041 点击    2026-09-04 11:07
腾讯“测试中”的Agent钱包,被亚马逊抢先了

腾讯“测试中”的Agent钱包,被亚马逊抢先了

腾讯“测试中”的Agent钱包,被亚马逊抢先了

亚马逊AWS宣布Amazon Bedrock AgentCore Payments正式进入GA阶段。此前还只有一些简单付费场景的预览功能,现在已经可以让 AI Agent在用户授权和预算限制下,自主购买付费API、MCP服务、数字内容以及模型推理能力。

来自主题: AI资讯
9013 点击    2026-08-21 13:04
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。

来自主题: AI技术研报
9893 点击    2026-08-17 15:18
太刑了,GPT-5.6、Fable 5被Oh My Pi作者攻破:完整导出模型推理记录!

太刑了,GPT-5.6、Fable 5被Oh My Pi作者攻破:完整导出模型推理记录!

太刑了,GPT-5.6、Fable 5被Oh My Pi作者攻破:完整导出模型推理记录!

近日,Oh My Pi 作者 can1357 在 X 上发文,展示了利用模型 API 漏洞,直接提取 GPT-5.6、Claude Fable 5 等顶级模型完整内部推理记录的方法。他发现,做到这些并不用破解加密,只需要关闭模型的隐藏思考,再给它一个思考工具,就能让模型主动输出内部推理格式。

来自主题: AI资讯
10819 点击    2026-08-14 17:13
“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!

在刚刚落幕的2026 WAIC世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构PDD。

来自主题: AI技术研报
5984 点击    2026-07-30 15:57
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

来自主题: AI技术研报
10000 点击    2026-07-23 10:39
当SFT遇上RL:基于样本学习阶段的动态策略优化机制

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

过去一段时间里,在围绕大模型推理能力增强的研究中,SFT 和 RL 是两类核心后训练范式 —— 前者稳定收敛快,能高效吸收高质量推理数据;后者更具探索性,有望推动模型实现复杂推理和分布外泛化。

来自主题: AI技术研报
8178 点击    2026-05-18 09:53