蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据
蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
搜索
训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
由两名00后大学生创办的美国AI训练数据公司AfterQuery五个月内估值从3亿美元升至32亿美元,其数据已用于英伟达Nemotron 3 Ultra模型训练,并与Thinking Machines Lab、Legora及部分中国AI实验室合作。
新加坡Physical AI公司Ropedia正式发布新一代多模态采集系统HOMIE Gen2,以4目全景360°、十余种模态同步采集与开箱即用的高精度训练级数据,将人类经验规模化为机器人可直接学习的训练数据,推动Physical AI的经验规模化落地。
AI 催生了许多新产业,今天分享的就是其中之一。今年5月,一名来自 WIRED 的记者做了一个有点奇怪的兼职。他把 iPhone 固定在头上,确保镜头能拍到自己的两只手,然后开始录自己:不是为了拍短视频。
近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。
8月18日,五一视界(51WORLD)“物理AI宏伟蓝图2030”发布会正式召开。
一批纸质书被买下,送进仓库。
机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。
随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。