万字硬核实测:国产办公Agent,最强平替是谁?
万字硬核实测:国产办公Agent,最强平替是谁?这一次,我就挑选了其中比较有代表性的三款:QClaw、WorkBuddy 和百度搭子,通过几组真实办公任务进行横向测试,看看国产办公 Agent 现在到底发展到了什么水平。横测标准:同一任务、同一素材、同一交付标准,每个任务只给一次主要执行机会。
搜索
这一次,我就挑选了其中比较有代表性的三款:QClaw、WorkBuddy 和百度搭子,通过几组真实办公任务进行横向测试,看看国产办公 Agent 现在到底发展到了什么水平。横测标准:同一任务、同一素材、同一交付标准,每个任务只给一次主要执行机会。
彭博社的一则独家报道如同一盆冰水,浇灭了所有人的热情:Gemini 3.5 Pro发布延期了,而且不是延期几天,是数月的大延期!本该是载入史册的发布,被谷歌自己按下了暂停。
Nile(https://nile.shop),这家15人的创业公司,想要帮助解决这个问题。他们要为品牌构建一个“AI原生后端”,让商家拥有属于自己的、能面向任何Agent做分发的“品牌智能体”。
最近,我和一位来北京融资,做出海营销 Agent 的创业者聊天。
近两年,视频生成模型在具身智能领域受到持续关注。从 UniPi、SuSIE 到各类 action-conditioned video generation 变体,其核心思路一致:先由模型生成一段未来视频,再从中提取动作信号供机器人执行。
首次亮相。
昨天那篇文章,我说了一下我现在用Agent的日常。
Emergent 是一家帮助小型企业利用人工智能构建应用程序的初创公司,近日完成 1.3 亿美元融资,跻身为数不多达到独角兽估值的印度 AI 初创公司之列。据该公司介绍,目前已有逾 1200 万个 AI 应用程序通过 Emergent 平台构建完成。Emergent 的运营总部位于班加罗尔。
近日,翁荔发布长文 《Harness Engineering for Self-Improvement》,系统梳理了 harness engineering 在 AI 自我改进中的作用。
WorldArena 1.0 的核心意义,在于将世界模型评测从 “好不好看” 推进到 “是否真的有用”。它不再只关注视频观感,而是把物理一致性、可控性、3D 准确性和具身任务功能性纳入统一评测框架,使许多看似流畅的生成结果第一次在机器人具身任务中接受检验。