Claude Code砸的坑,蚂蚁安全在尝试填上
Claude Code砸的坑,蚂蚁安全在尝试填上2026年,AI安全终于被推到了台前。
搜索
2026年,AI安全终于被推到了台前。
Opus 5可能要来了!有开发者意外发现,一款名为Honeycomb EAP神秘模型,1M上下文,代号「蜂巢」,在「模型列表」中短暂现身。大家一致推测,这就是Opus 5「早期预览版」,可能在月底上线。
Fable 5 在远程劳动力指数(Remote Labor Index,RLI)上拿到了 16.1% 的自动化率,几乎是第二名 Opus 4.8(8.3%)的两倍,更是第三名 GPT-5.5(6.3%)的 2.5 倍。
近日,Anthropic官方发了一篇长文专门来讲这件事。 起因是太多人把Claude Code里的两个选项搞混了:一个是模型选择(Model),一个是努力度(Effort)。过去,大家对这两个选项的理解都很简单:换更大的模型,AI就更聪明;把Effort调高,无非是让AI多想一会儿。
这回,Anthropic要劝你,别太沉迷Claude了。它上线了Reflect功能的Beta测试版,面向Free、Pro、Max用户开放。这个藏在设置里的面板,想帮你搞清楚一件事:什么时候该用Claude,什么时候该关掉它。
7 月 9 日,OpenAI 一口气发了三样东西,新模型 GPT-5.6,一个把 Chat、Work、Codex 装进同一个壳的新桌面应用,以及本文的主角 ChatGPT Work。官方的说法是,ChatGPT 从此不再只是回答问题,而是把活真正干完,交出来的不是聊天记录,是表格、文档、PPT,甚至一个能直接分享的网站。
Anthropic正式发布「/checkup」命令。它相当于一个一键式的智能优化管家,用Anthropic的话这就是智能体的「医生」。一句话说清它干的事:把程序员平时手动伺候的那一堆配置,一个命令,全给你收拾干净。
就在刚刚,GPT-5.6 系列正式登场,一口气发布三个型号:旗舰 Sol、均衡款 Terra,还有主打性价比的 Luna,名字分别取自拉丁语里的太阳、地球/大地和月亮。价格上,Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 直接减半,2.5 美元和 15 美元;Luna 最便宜,只要 1 美元和 6 美元。
最近发现了一个很便宜的平替方案,是在X上刷到的一个很有意思的开源项目:OpenSquilla 0.5.0(在Github 已经有5.5K Star)当时我还发了一篇推文。它揭示了一个非常反常识的事:一组便宜的国产模型以一定的方式组合起来,居然可以在公开评测上打赢国外更强的旗舰模型们(Claude Fable 5、Opus4.8、GPT-5.5)
这个 JavaScript 运行时原本拥有 535,496 行 Zig 代码,不包括注释;同时,约 20% 的代码由 C++ 编写,并嵌入了多个 C/C++ 库。此次借助 AI 重写为 Rust,整个过程涉及超过 100 万行代码变更、6778 次提交,并在 Claude Code 中运行了大约 50 个动态工作流(dynamic workflows)。