AI资讯新闻榜单内容搜索-token

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: token
大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level熵变揭示RLVR训练机制

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。

来自主题: AI技术研报
9942 点击    2026-07-16 10:10
ISSTA 2026|LAVE:面向扩散语言模型的约束解码

ISSTA 2026|LAVE:面向扩散语言模型的约束解码

ISSTA 2026|LAVE:面向扩散语言模型的约束解码

推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。

来自主题: AI技术研报
8695 点击    2026-07-16 10:09
用推理步骤的「语义冗余」给LRM过度思考踩刹车

用推理步骤的「语义冗余」给LRM过度思考踩刹车

用推理步骤的「语义冗余」给LRM过度思考踩刹车

推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。

来自主题: AI技术研报
5584 点击    2026-07-16 10:08
首发| AI Token工厂爆发,趋境科技完成A轮亿元融资

首发| AI Token工厂爆发,趋境科技完成A轮亿元融资

首发| AI Token工厂爆发,趋境科技完成A轮亿元融资

一笔融资进入我们视野——今日(7月13日),趋境科技A轮融资浮出水面,由河南投资集团汇融基金重磅领投,真知资本、尚势资本、星连资本、上海国方创新、弘晖基金、华控基金、杭州福成等老股东继续超额增投。

来自主题: AI资讯
9080 点击    2026-07-15 10:28
无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线

过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?

来自主题: AI技术研报
7258 点击    2026-07-14 11:07
驭驯网络融资数千万,用ZCube重构AIDC网络基建,3个月拿下过亿订单

驭驯网络融资数千万,用ZCube重构AIDC网络基建,3个月拿下过亿订单

驭驯网络融资数千万,用ZCube重构AIDC网络基建,3个月拿下过亿订单

一家推翻传统网络架构的清华系创业公司,联合智谱、清华大学推出了全新的网络架构ZCube,能提升推理算力集群15%的Token产量,还能砍下约33%的网络硬件成本。近日,驭驯网络已完成智谱独家领投的数千万元融资,源合资本担任长期财务顾问。

来自主题: AI资讯
8676 点击    2026-07-14 09:43
Agent专用搜索AnySearch登顶Product Hunt,Token更省搜得更准

Agent专用搜索AnySearch登顶Product Hunt,Token更省搜得更准

Agent专用搜索AnySearch登顶Product Hunt,Token更省搜得更准

本期Product Hunt周榜Top 1出自中国团队,AnySearch——一款AI搜索产品。过去一年,PH榜一的位置被Agent、AI IDE、大模型轮番占据,几乎没见过搜索类产品的影子。就是因为在全球开发者眼里,普通AI搜索已经很难突围了。

来自主题: AI资讯
9670 点击    2026-07-13 19:52
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。

来自主题: AI技术研报
7181 点击    2026-07-13 14:44