可算找到一个能统一管理所有Agent还不用额外订阅的开源项目了!
可算找到一个能统一管理所有Agent还不用额外订阅的开源项目了!我天天在ai news radar里刷呀刷,真刷出了个新的开源项目,Tutti。光看Readme的时候,我以为它又是一套给Agent套GUI的桌面壳,实际上它提供了一个实时共享的工作空间,我所有agent可以共享上下文,文件,应用和任务。
搜索
我天天在ai news radar里刷呀刷,真刷出了个新的开源项目,Tutti。光看Readme的时候,我以为它又是一套给Agent套GUI的桌面壳,实际上它提供了一个实时共享的工作空间,我所有agent可以共享上下文,文件,应用和任务。
昨天早上我想给 Claude 的一篇文章配几张 3:4 的社交媒体图。手边有自己做的社交媒体 Skills,就顺手让 Codex 调了 GPT-Image 2.0。出来的效果超出预期。干净白底,克制的 3D 材质,中文标签直接印在图里,远看像杂志内页,近看细节都读得清。
手机GUI Agent正在从「看懂屏幕、点击按钮」走向更复杂的跨App自动化任务:这些任务听起来并不复杂,但对现有手机GUI Agent来说,一个核心难题始终存在:任务一长,就容易忘。
前段时间我做了一个 guizang-social-card-skill(https://github.com/op7418/guizang-social-card-skill)。
想训练能自动操作手机的GUI(图形用户界面)智能体,总会遇到两难困境:
Agent从来不是不会用浏览器,只是浪费太多时间在探索——BrowserBC把人类轨迹蒸馏成可复用Skill来完成Behavior Cloning,用户点一遍,Agent照着就能跑通。Einsia AI旗下Navers Lab发布的开源项目BrowserBC给出的答案,是一条三步范式:录制→转写成Skill→交付执行。
扩散模型又被玩出新花样了。
独家获悉,GUI Agent(图形用户界面智能体)执行平台 「Core-Mate」 近日宣布完成数千万人民币融资。核心团队主要来自字节跳动,成员在用户产品、业务增长和商业化落地中积累了系统经验。在团队看来,下一代 AI 产品的关键不只在模型能力,也在入口、场景和用户行为。
如何让 Agent 把浏览器用得更 6,一直是一个还没有完美解答的课题。周末躺床上刷 GitHub trending,看到一个项目名字叫 BrowserAct。简介写着:AI Agent 操作真实浏览器。
中科院自动化所模式识别实验室开源MobileGym,运行在浏览器里的高并发安卓仿真平台,完全自定义,告别模拟器风控与真机成本,一个平台搞定Mobile Agent训练与评测,甚至还能玩原神!