Manus团队测模型一点微小的经验
Manus团队测模型一点微小的经验Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
搜索
Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
Manus正式恢复独立运营,由肖弘、张涛和季逸超组成的原创始团队继续领导公司,未来将重点推动通用AI智能体产品研发,并透露更多新产品和功能即将发布。
刚把Manus吐回去,Meta转头自己做了一个智能体平台“Hatch”。 小扎这是不甘心啊…… The Information消息称,Hatch功能上强调“给出目标、自动拆解并交付结果”,看着与Manus差不多吧,但非要换个宣传口径叫“消费者版的OpenClaw”。
Manus,完成复活赛了!是的,那个被Meta收购的Manus,刚刚正式宣布回归自由身:值得注意的是,公告里反复强调「新加坡时间」。而且官方明确写明,恢复独立后,用户数据将存储在美国和新加坡。
过去两年,AI智能体(Agent)完成了一次身份转变。
奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。
刚刚,英国《金融时报》援引两位知情人士报道,Manus此前的投资方,包括腾讯、真格基金、红杉中国(原红杉资本中国基金),正讨论按Meta收购时的估值20亿美元(约合人民币136亿元)完成对Manus母公司蝴蝶效应的股权回购,腾讯预计将收购最多的股份,但仍保持少数股东身份。
AI Agent正在从“会回答”走向“能办事”,但真正的门槛也随之出现:它们能不能在复杂、漫长、不可预测的任务里持续做对?这家公司正在为AIAgent搭建一套“数字世界”测试场,让它们在真正接管网页、企业系统或金融流程前,先在模拟环境里反复试错、暴露漏洞。
眼下具身赛道都在卷世界模型,都在抢着做机器人的“大脑”。
Patronus AI 今天官方宣布公司完成由 Greenfield Partners 领投的 5000 万美元 B 轮融资,Lightspeed Venture Partners、Notable Capital、Datadog、三星、Gokul Rajaram、Factorial Capital 以及来自我们实验室和新实验室的众多人工智能领军人物也参与了本轮融资。