15个推理模型集体翻车,详解输出背后的思考链潜藏风险
15个推理模型集体翻车,详解输出背后的思考链潜藏风险哈佛大学、南加州大学、布朗大学、MIT 等多个机构的研究者联合做了一项系统性研究,给出了否定的答案,并举例到「当我们发现大模型的思考链可被用于生成炸弹装置或投毒配方等高风险内容时,便意识到这一问题非同小可」。
搜索
哈佛大学、南加州大学、布朗大学、MIT 等多个机构的研究者联合做了一项系统性研究,给出了否定的答案,并举例到「当我们发现大模型的思考链可被用于生成炸弹装置或投毒配方等高风险内容时,便意识到这一问题非同小可」。
近日,北京航空航天大学史振威教授和邹征夏教授团队发布了一个面向通用遥感目标检测的大规模数据集与基础模型框架 ——LEVIRDet。该研究构建了目前最大规模、最全面的遥感目标检测数据集 LEVIRDet-159,并在此基础上提出了面向通用遥感检测的基础模型 LEVIRDetNet。
美团今日宣布开源万亿参数大模型LongCat-2.0,同步开放针对国产算力芯片深度优化的推理代码。该模型总参数达1.6万亿,平均激活约480亿参数,是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。
GPT-5.6 Sol预览版发布小半个月了,首批用户内测报告终于新鲜出炉!英伟达首席工程师用最直白最不绕弯子的话告诉你:Sol很猛!30小时,就跑赢了Opus 64小时才达到的CUDA加速效果。后续版本优化后,或将彻底碾压Opus……
近期, ECCV 2026 结果公布,Realsee 团队的成果 Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes 成功入选。它面向室内全景图像,能够从稀疏、无序的全景照片中,直接预测相机位姿、度量深度和点云重建结果,可以为 3DGS 提供更稳定、更精准的几何约束。
Greg Isenberg 最近在他自己的播客 The Startup Ideas Podcast 里讲的一个判断,他说了一句很直白的话,building agents is the new SaaS,做 agent 就是新时代的 SaaS。
有人把 YC 2026 春季批次的 launch,一家不落地全看了一遍。196 家公司,395 个创始人,上周刚 Demo Day。95% 的公司沾 AI,70% 在做 agent。可它们的定位,没有一家是「我们用了 AI」。区别只在于,这句「换掉人」,被包装成了几种不同的话术。
今天凌晨刷到Anthropic发了一篇研究。标题叫《A Global Workspace in Language Models》,语言模型中的全局工作空间。如果用一句最简单的话来说,那就是,Anthropic在Claude的大脑里,找到了一个暗房间。
两个月的时间,混元 3 正式版上线。结合了用户对预览版的反馈以及对模型稳定性和可用性的提升,Hy3 在 Agent 和 Coding 能力上有了实质的提升。我们做了多个前端网页的生成测试,大多数都包含复杂的 3D 网页模拟、严格的游戏逻辑,以及需要调用不同的框架和库文件,Hy3 交付的内容要比预览版好上一个等级。
上周有个项目,让我觉得很有意思。GitHub上一个叫OpenSquilla的,发布不到一个月,Star涨到了5300多。OpenSquilla 0.4.0,定位Token-Efficient AI Agent,是一个很有效率又很有创意的智能体框架。