
能自己做实验、写代码、找规律,还会越研究越聪明。
智东西7月21日报道,今天,腾讯正式发布了其首个研究智能体(Research Agent)——Hyra(Hunyuan Research Agent)。Hyra能够像科研人员一样,提出假设、完成实验、总结经验,再基于经验不断提出新的方案,最终实现递归自我改进(Recursive Self-Improvement,RSI)。

从腾讯公开的实验结果来看,Hyra已经可以在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个方向发挥作用,并在多个公开任务中刷新已有纪录。
比如,在科研领域,Hyra设计出了一个仅含15个可训练参数、即可完成10位数加法的Transformer,相比Adderboard公开纪录中的36个参数减少了58.3%。这一结果证明Hyra能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供帮助。
Hyra也可以通过观察AI模型训练日志,发现模型的Scaling Law,指导训练配方的设计。
Hyra并不仅限于科研,也可以用于3D建模、音乐创作等创意场景。比如,在拿到一段主旋律后,Hyra可以为多种乐器编写完整和声,逐步将一段原本保守的和声迭代为多乐器、灵活节奏和丰富色彩的完整音乐。

腾讯还在博客中透露,新一代Hy模型、乃至腾讯的部分产品,都会与Hyra持续共进化。
研究博客:https://hy.tencent.com/research/hyra
采用轻量Harness设计
有效防止AI“作弊”
过去一年,递归自我改进已经成为全球AI领域最受关注的技术方向之一。Google DeepMind推出AlphaEvolve,将Gemini用于算法发现,把4×4复数矩阵乘法的标量乘法次数压缩到48次;Together AI通过Einstein Arena让多个智能体协同探索数学开放问题;Andrej Karpathy也提出autoresearch,希望让模型训练实验能够自动循环运行。
不过,上述研究主要聚焦单一方向的探索,腾讯此次发布的Hyra希望构建一套通用研究框架,让智能体能够进入AI研发、科学发现乃至工业设计等更多真实环境,不断积累经验、自主进化。
科研真正困难的地方,是在一次次实验失败之后,不断总结经验、调整方向、重新设计实验,再继续验证。这本质上是一个不断循环迭代的搜索过程,也是科研智能体区别于普通智能体最大的地方。
Hyra的核心设计,就是围绕这一循环展开。
整个系统没有设计复杂的工作流,而是采用了一套非常轻量的Harness。腾讯团队认为,这一思路遵循Rich Sutton提出的The Bitter Lesson:长期来看,真正能够持续胜出的,并不是人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥作用。
Hyra智能体的整个系统只有两个核心角色,其架构如下:

其中,一个Context Agent负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果、生成文件都会被保存下来,再不断整理成新的“灵感”,提供给下一轮探索使用。
另一侧,则是多个Proposal Agent。
它们不断领取不同的灵感上下文,提出新的方案,自动生成完整解法,并进入独立沙盒执行。程序运行结束后,系统自动打分,再将结果重新写回经验库。
整个系统则始终保持异步运行。Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,计算资源、沙盒环境、模型推理始终保持高利用率。Context Agent会将灵感准备得尽可能多样化,让Proposal Agent可以朝着多样的方向探索。
Hyra不仅优化方案,还会优化评测标准。很多科研问题并不存在天然评估其,例如设计一个世界冠军级国际象棋AI,最开始只能设计一个简单的Elo评测系统,随着越来越强的AI不断出现,评测体系本身也要不断升级,否则AI很容易“刷分”而非真正变强。
为解决上述问题,腾讯混元团队提出了一套双层循环机制。
首先,Hyra会根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化解法;当内层循环结束后,Hyra会结合当前经验中积累的经验历史进一步优化评估器,并使用升级后的评估器开启下一轮循环。味着,Hyra优化的不只是答案,而是整个科研流程本身。
从模型优化到药物设计
Hyra展现多领域潜力
科研智能体最终还是要靠结果说话,腾讯此次展示了十多个由Hyra执行的科研任务案例。
首先是在AI for AI方向。
模型训练是最适合科研智能体发挥作用的领域之一,其中包含大量可执行、可评估、可迭代的研究循环。
腾讯选择了三项公开任务进行评测,包括NanoChat Autoresearch、NanoGPT Speedrun以及NVIDIA推出的SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU kernel优化。
在采用完全相同实验设置的情况下,腾讯将Hyra与AI初创公司Recursive打造的研究智能体进行了对比。在NanoChat任务中,Hyra将Validation BPB进一步下降至0.9015;在NanoGPT Speedrun中,Hyra将达到指定Loss所需时间缩短至76.4秒;在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771,均超过基线水平。

与此同时,腾讯也展示了科研智能体面临的问题。
随着搜索越来越强,AI开始主动寻找评估器漏洞。例如,在NanoChat实验中,Hyra曾尝试通过泄露未来Token信息,获得异常优秀BPB成绩;而在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。
这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续升级,否则所谓“进步”可能只是作弊。
Hyra还在AI for Science方向展示出不错的潜力。
腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题。最终,Hyra在其中29个问题上刷新历史最佳结果。
它还能直接从数据中寻找规律。当获得1749年至1932年的太阳黑子历史数据后,Hyra自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。

Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法在IBM Q20上相比经典SABRE将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。

在药物设计任务中,Hyra围绕精准抗癌“明星靶点”PARP1自动生成候选分子,在结合能力和成药性联合评分上超过已上市PARP抑制剂奥拉帕利(Olaparib)。当然,腾讯也强调,这一药物设计结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。

除了科研,Hyra也可以进入更多开放场景。它通过持续自博弈,把一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。

或是根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。

这些案例共同说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立反馈机制,智能体都能够持续搜索、不断演进。
结语:科研智能体或成
下一代AI系统重要形态
随着大模型能力不断提升,如何让AI自己加速AI的发展成为不少大模型企业开始考虑的问题,芯片、药物等领域的企业也正在尝试把科研过程本身交给AI完成。
未来,科研智能体能否真正成为科学发现的新工具,还有待更多真实场景验证。但可以确定的是,AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识。而能够持续自我改进、自我研究的智能体,也很可能成为下一代AI系统的重要形态之一。
文章来自于微信公众号 “智东西”,作者 “智东西”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LGM是一个AI建模的项目,它可以将你上传的平面图片,变成一个3D的模型。
项目地址:https://github.com/3DTopia/LGM?tab=readme-ov-file
在线使用:https://replicate.com/camenduru/lgm