DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。
搜索
图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
Hermes Agent发布代号"万神殿"的新版本,重点优化Bot Mode并支持多Agent以独立身份加入群聊协作、@单独召唤及任务中断,还为Cron定时任务新增持久记忆并补强了安全机制。
由最早看好Kimi的前红杉投资人张尧创立的Converge AI,同时推出Enter Pro、Framia Pro、Concat Pro、Combos Fun和AnyCap等多款覆盖开发、创作、营销、游戏和Agent基础设施方向的AI产品,并通过Converge Work将其接入统一上下文。
Runway发布首个界面世界模型Solaris,基于Gen-4.5视频生成模型与GWM-1世界模型技术,用户通过点击、拖拽或输入文本即可实时生成交互界面而无需编写代码,该系统还可用于训练Computer Use Agent。
导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。
一个 Agent 到底凭什么越来越强?有人靠更大的模型,有人靠更多数据。就在前天,Google Research 最新发布的 WikiSkill 给出了另一条答案:给 Agent 搭一套三层知识架构,让技能自己进化。
今年发了这么多期短剧Agent创作平台,我发现市面上专门针对TVC制作的,超级少。
今年三月,OpenMAIC 正式开源,用户已经可以借助 AI 完成一节课的设计与生成。
Dify 正式推出全新 Agent 体验,将 Agent 从工作流中的执行节点升级为拥有独立配置与完整生命周期的独立实体,提供 Build、Manage、Track 三层能力及 Tool、Skill、Sandbox CLI 三种扩展方式,支持企业 AI Agent 跨场景复用与持续演进。