单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!
单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。Codex 生产 trace 的中位 decode 速度是 33 token/s
搜索
本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。Codex 生产 trace 的中位 decode 速度是 33 token/s
位于北京海淀的互联网金融中心,任利锋创办的“数美万物”在这里有3个办公地点。其中的一间不是办公室而是实验室,他们采购来市面上主流的3D打印机,在实验室桌面上次第排开,每天打印自研生成式3D模型生成的东西。经自研模型Hi3D生成的图纸打印出的实物有没有破面或其它瑕疵,又如何改进、修补,都在这间屋内见分晓。
8月13日,一篇报道把一场持续了小半年的争议直接推到了脉脉上关于美团话题的最热的位置,主角是一个AI编程领域的网红叫"阿酥在coding"。到目前为止,当事双方都没有再次回应,事情比较长,先给不了解事
这就是 Generalist 最新发布的 GEN-1.5 具身基座模型展现出的能力:模型开始从大规模人类操作数据中天然存在的重复、失误与恢复,学习到训练者没有逐项教过的动作,显露出某种智能涌现的迹象。
初创公司Groq已完成3.5亿美元融资,继续推进其从AI芯片制造商向新云公司的转型,致力于提供强大的GPU及AI基础设施服务。本轮融资由投资公司Disruptive领投,英伟达计划参与其中,此次融资对该公司的估值为35亿美元。
百灵为开发者提供了多个可继续训练的起点。今日,蚂蚁百灵开源Ling-3.0-tiny-base和Ling-3.0-flash-base。除最终Base模型权重外,团队还同步开放了两款模型的预训练和中期训练权重,共计6个checkpoints。
一个大厂程序员,辞职之后没去创业公司,也没去做 AI 项目,而是跑到了宁夏,养了一万多只羊——更离谱的是,这羊养着养着,他又重新捡起了老本行:写代码。
GLM 5.3发布后不到一小时,智谱一名销售的电话和微信都爆了:十几个来询问API上线时间的,以及吸取了Kimi K3教训,想提前锁定智谱推理算力的客户也不少。这种状况一直持续了整个周末。
当一个视频模型和 Seedance 2.5 同一天发布,似乎大概率要成炮灰,但 MiniMax H3 却成了一个例外。而现在 MiniMax 也开始把这种模型的能力,放到了具体的产品上,正式推出了 MiniMax Design,进一步把 H3 视频模型的能力放大,同时也让我们少折腾一些,可以更高效地制作各种商业化内容。
韩国济州岛,KDD 2026现场。