纯血国产!4B模型越级打怪,杀入万亿赛道
纯血国产!4B模型越级打怪,杀入万亿赛道就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。
搜索
就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。
在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。
外挂补不了模型智商,《苦涩的教训》再次上演。
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……
近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
一位个人开发者,竟然在一众大厂中,杀进了抱抱脸Models Trending榜的前排?!突然出现了一个个人账号:yuxinlu1。再一看下载量——最新数据已高达20.7万和53.6万。好家伙,这是什么神仙模型来了?
最近几天,一个 3B 的小模型在 X 上火了,因为在一些难度可验证的推理任务上(比如编程),它进入了 Gemini 3 Pro、GPT-5 high、Claude Opus 4.5、GLM-5、Kimi K2.5 等前沿模型的性能区间,而它的体积远小于这些模型。
大模型再强,也读不懂你公司那一柜子的合同、发票和扫描件。在"纸张世界"和"LLM世界"之间,缺一座桥——而百度开源的 PaddleOCR,可能就是当下最稳的那座。
就在刚刚,Siri借谷歌的1.2万亿参数Gemini「重生」了!在今夜的苹果WWDC 2026上,Siri彻底迎来新生。结合设备端小模型,苹果打造了混合智能架构,让Siri在各个APP之间无缝穿梭。