突发!Gemini 3.8登顶,谷歌迈出RSI一大步
突发!Gemini 3.8登顶,谷歌迈出RSI一大步谷歌正式发布Gemini 3.8 Flash及网络安全专用版Gemini 3.8 Flash Cyber,前者以极低单任务成本在多项基准测试中逼近GPT-5.6 Sol、Grok 4.6等顶级模型,并在软件工程和速度上实现大幅跃升,后者则在漏洞发现基准CyberGym上以86.2%的成绩屠榜,谷歌DeepMind称这标志着RSI(递归自我进化)迈出了一大步。
搜索
谷歌正式发布Gemini 3.8 Flash及网络安全专用版Gemini 3.8 Flash Cyber,前者以极低单任务成本在多项基准测试中逼近GPT-5.6 Sol、Grok 4.6等顶级模型,并在软件工程和速度上实现大幅跃升,后者则在漏洞发现基准CyberGym上以86.2%的成绩屠榜,谷歌DeepMind称这标志着RSI(递归自我进化)迈出了一大步。
7月29日消息,深信服公布其AI安全智能体Sangfor AI在AI安全评测CyberGym中的最新成绩。
太疯狂了!一个连官网都没有的神秘中国AI「扫地僧」,以73.1%的胜率杀入CyberGym全球前七,紧咬OpenAI。全网都在疯传,这到底是谁家的高手?它叫MopMonk(扫地僧)。凭借73.1%的成功率,以微弱差距紧咬OpenAI,一举刷新了中国团队在该榜单上的历史最高分。
就在刚刚,OpenAI 直接放出了满血版 GPT-5.5-Cyber。CyberGym 安全评测排行榜,GPT-5.5-Cyber 得分 85.6%,单模型最高分。Claude Mythos 5 第二,83.8%。Claude Opus 4.7 排末尾,73.1%。
微软用一套多 Agent 系统在 AI 漏洞发现的顶级基准测试上拿下第一,超过 Anthropic 最强模型 Mythos 五个百分点。诡异的是,微软自己并没有一个能打的前沿模型。它用别人的模型组了个系统,打败了造出这些模型的公司。这对AI竞争格局的启示,比这个工具挖出了大量 Windows 漏洞本身更重要。