ISSTA 2026|LAVE:面向扩散语言模型的约束解码
ISSTA 2026|LAVE:面向扩散语言模型的约束解码推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。
搜索
推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。
前几天在 github 上有个开源项目非常的火爆,就是 甲木 × 摸鱼小李 大佬联名首发的公众号排版 Skill ,不仅是设计有美感,而且又简约清新,不到几天,就斩获了 1.9k 的 stars
最近发现了一个很便宜的平替方案,是在X上刷到的一个很有意思的开源项目:OpenSquilla 0.5.0(在Github 已经有5.5K Star)当时我还发了一篇推文。它揭示了一个非常反常识的事:一组便宜的国产模型以一定的方式组合起来,居然可以在公开评测上打赢国外更强的旗舰模型们(Claude Fable 5、Opus4.8、GPT-5.5)
小红书上,#deepseek 算命、#赛博玄学等话题下,大量玄学爱好者聚集,分享不同占卜体系的prompt、交流 AI 算命心得,仅 #deepseek 算命一个话题,浏览量就达到 5608 万、讨论量 35.4 万;与此同时,更深度的 AI 用户开始在 GitHub 上自行开发占卜 Skills,搜索“astrology”“bazi”等关键词,可以看到相关项目最高 Star 数已达 3.9k。
这个问题,在 AI 行业有一个专业的说法:无状态(Stateless)。而解决这个问题,正是 EverMind 过去一直在做的事情。今天,这个探索走到了一个新的节点:基于自研记忆系统 EverOS 的自进化Harness——Raven Agent 正式发布。
MrFlow(Multi-Resolution Flow Matching)就用这样的三阶段,在Qwen-Image等模型上把端到端生成时间从49.32s压到4.77s,实际加速10.35x。文章发布当日即登上Hugging Face Daily Papers;发布三天内,GitHub已收获200+stars;目前也已登上Hugging Face Trending Papers。
朋友,听说你还不会搭不会用Loop?别慌!现在直接来抄作业!有位大神直接在GitHub开源了整套Loop Engineering框架,目前已累计收获4.5k Star。Loop是最近爆火的概念,简单解释就是不用再像以前一样一次次输提示词指挥AI干活。
GitHub上有个项目叫 Project N.O.M.A.D,33k Star,3k Fork。作者 Chris Sherwood 是个搞网络设备的 YouTuber,Crosstalk Solutions 频道有 38 万多订阅。这项目说白了就是把维基百科、本地 AI、离线地图、离线教育平台全塞进 Docker 里,断网也能用。
如果你的日常任务里包含编程,今天给大家介绍一个特别适合团队用的AI开发平台「MonkeyCode」,目前在GitHub已狂揽3.4k Star,开源免费。开源地址:github.com/chaitin/MonkeyCode
Greg Isenberg 最近在他自己的播客 The Startup Ideas Podcast 里讲的一个判断,他说了一句很直白的话,building agents is the new SaaS,做 agent 就是新时代的 SaaS。