A社故意黑化Opus,模拟入侵Hugging Face,抱抱脸:?
A社故意黑化Opus,模拟入侵Hugging Face,抱抱脸:?Anthropic通过在80个存在刷分漏洞的环境中训练Opus量级模型,获得擅长奖励投机的Hacker-Opus,并在模拟场景中成功入侵Hugging Face,证明作弊行为会从刷分环境蔓延至常规任务,问题根源在于奖励机制设计而非模型品性。
搜索
Anthropic通过在80个存在刷分漏洞的环境中训练Opus量级模型,获得擅长奖励投机的Hacker-Opus,并在模拟场景中成功入侵Hugging Face,证明作弊行为会从刷分环境蔓延至常规任务,问题根源在于奖励机制设计而非模型品性。
导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。
模型不更新,能力却持续增长。
Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。
懂模帝Bench黑客松是一个在网吧举行的严肃活动。
FUMO Lab正式发布Fusion Model,在推理、行业、编程、科学四项顶尖公开测试集上全部位列第一,通过动态分配异构模型能力的智能分配机制,可在保持任务质量的同时将成本降低约30%–40%。
前两天刷 X 的时候,一条 Twitch 直播的录屏给看傻眼了: FAL 工程师 Rehan Sheikh 将 MiniMax H3 Max 接入 Twitch 直播流,搭建了一个由模型持续生成内容的频道,并把它称为「跨维度电视」。
不得了。 谷歌刚刚更新的Gemini Omni 1.1 Flash,直接冲上了Arena文生视频全球第一。
本周「十字路口」的嘉宾是 Pyromind 创始人 / CEO Kevin Ding。Pyromind 所在的赛道,常被称作 RL as a Service,也就是强化学习即服务、或后训练即服务。公司前不久完成天使轮融资,投资方包括高瓴、百度风投、蓝驰、Atypical 等机构。
如果说大语言模型拉开了本轮人工智能革命的序幕,那么今天人机交互的瓶颈,早已不再是模型的智商,而是人类接收信息的生理带宽。