无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线
无需视觉 tokenizer,北大PRA解锁自回归图像生成潜力,135M模型性能反超1.9B基线过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?
搜索
过去几年,扩散模型几乎定义了高质量图像生成:从随机噪声出发,经过多轮迭代,逐步 “雕刻” 出一张图像。但随着大语言模型席卷人工智能领域,另一条路线正迅速走到舞台中央 —— 图像,能否也像语言一样,通过自回归方式逐步生成?
大家好,我是极客杰尼。 今天,md2wechat 正式发布 3.0.0 大版本,这次最重要的变化,是普通创作者也能让 Agent 帮自己完成多图和 SVG 排版。
7月13日,阶跃星辰在上海正式发布面向智能体时代的大模型原生AI终端品牌STEPX,并同步推出全球首个智能体原生操作系统Step AOS(Step Agentic-native OS)和阶跃新一代个人智能体阶跃Amoo,正式打通了从基座模型、智能体系统到硬件终端的完整链路。
4月30号,快手Krow团队推出了一款桌面端AI智能体KroWork,在这里你不用写一行代码,对着它说一句话,它就能自己写代码、调试、部署,最后交付一个能直接在桌面运行的应用。
把一个Bug交给Claude Code或Codex,十几分钟后它回了一句“Done”和一大片Diff。过程中它读错了什么、为什么反复改同一个文件、最后有没有重新跑测试......开发者想知道就只能去几百行日志里碰运气。7月11日,一个名叫Mindwalk的开源项目发布了v0.1.0。
2026年,视频生成赛道正在经历一场从“离线生成”到“实时交互”的范式转移。7月3日全球数字经济大会上——生数科技创始人朱军正式发布Vidu S1实时交互模型,让AI从“视频生成”正式迈入“实时交互”的新阶段。
Lyzr 的为其 Agent B 轮融资开展外联活动。该轮融资据公司称有望筹集 1 亿美元,估值约为 5 亿美元。Agent 回应了来自 130 多位投资者的查询,并协助起草了数十份投资备忘录。最终,这家获得 Accenture 支持的公司吸引了来自硅谷基金、中东风投公司和金融行业投资者共计 4 亿美元的兴趣。
一家推翻传统网络架构的清华系创业公司,联合智谱、清华大学推出了全新的网络架构ZCube,能提升推理算力集群15%的Token产量,还能砍下约33%的网络硬件成本。近日,驭驯网络已完成智谱独家领投的数千万元融资,源合资本担任长期财务顾问。
这家名为 PrismML 的初创公司表示,已将 Qwen 3.6 缩减至可在 iPhone 17 Pro 上运行,该模型拥有 270 亿参数(参数大致类似于大脑中的突触,能够帮助决定模型可处理数据的复杂性)。相比之下,大多数在手机上运行的模型一次仅有几十亿个参数处于活动状态。
图片来源:Unsplash 在 ChatGPT 的发布将生成式人工智能带入主流市场三年多之后,OpenAI 正将其关注点从个人用户扩展到家庭。 OpenAI 正在旧金山招聘一名专职产品经理,负责在其产