AI不缺算力,缺的是一块“懂模型”的硬盘
AI不缺算力,缺的是一块“懂模型”的硬盘寅谱试图用一种“以存换算”的思路破题:不是让硬盘SSD替代GPU计算,而是用更低成本的SSD承接温冷(指访问频率极低和中等)的AI大模型数据、复用已经完成的中间结果,减少显存及内存压力、GPU等待和重复Prefill(预填充)。
来自主题: AI资讯
8244 点击 2026-08-30 12:05
搜索
寅谱试图用一种“以存换算”的思路破题:不是让硬盘SSD替代GPU计算,而是用更低成本的SSD承接温冷(指访问频率极低和中等)的AI大模型数据、复用已经完成的中间结果,减少显存及内存压力、GPU等待和重复Prefill(预填充)。
在 AI 工程界,长文本推理一直是个“富贵病”。
把长上下文做到极致的Kimi又发新成果!
TL;DR:DuoAttention 通过将大语言模型的注意力头分为检索头(Retrieval Heads,需要完整 KV 缓存)和流式头(Streaming Heads,只需固定量 KV 缓存),大幅提升了长上下文推理的效率,显著减少内存消耗、同时提高解码(Decoding)和预填充(Pre-filling)速度,同时在长短上下文任务中保持了准确率。
Adobe公开了“Project Fast Fill”功能,这是一种使用生成式人工智能,通过文本提示互动的方式,可以在视频中移除人物、添加物体以及替换颜色的功能