从自动驾驶到物理 AI,吴甘沙创业十年的生存法则。
2016 年,万人出发。2026 年,只有极少数人还在跑。
十年前那批涌入自动驾驶赛道的创业者,绝大多数已经退场。留下来的人不是跑得最快的,而是最懂节奏的。驭势科技董事长兼 CEO 吴甘沙,就是其中一个。
7 月 17 日,北京,2026 奇点智能产品大会主会场。吴甘沙站在台上,用一个极其东方的思维框架,拆解了一家物理 AI 公司如何在巨头环伺中活过十年——他把《孙子兵法》的“不败”与“不战”,和诸葛亮《隆中对》的“益州”“荆州”格局,嵌入了一套完整的创业竞争策略。

这不是一次技术布道,而是一个长跑者回头看自己脚印时的坦诚复盘。
他说,自动驾驶的能力进化曲线,达到 99 分相对容易,但最后 1% 需要 99% 的时间和努力——这既是创业公司的生死线,也是巨头无法速胜的护城河。他把竞争拆成“竞”和“争”两个字:前 15 到 20 年是马拉松,各跑各的跑道;最后 5 年才是角斗赛,你死我活。而马拉松不能只为苟活,“你边跑必须得边练出角斗的本领”。
他用《隆中对》的逻辑解释驭势的空间选择:乘用车是“荆州”,巨头厮杀之地;商用车是“益州”,天险加粮仓。短期以益州为主,兼顾荆州,先安身立命,再图谋天下。而驭势找到的那座“益州”,是全球机场——目前中国前 20 机场中的 15 家、世界前 10 机场中的 3 家,都在用驭势的无人化方案,市场份额超过 91%。
他还分享了一个让人印象深刻的判断:自动驾驶的终点不是“车不撞人”,而是 AI 在物理世界中学会和不确定性共存。

吴甘沙,驭势科技董事长兼 CEO
以下为吴甘沙的演讲实录:

物理世界的 AI 产品经理,面临的是完全不同的游戏规则
大家好,我是驭势科技吴甘沙。非常感谢 CSDN 和奇点智能研究院的邀请,让我创业十年之后,又一次回到技术社区。
坦率地说,这十年的创业并不是一次轰轰烈烈的英雄之旅,而是一次孤独的长跑。2016 年我们出发的时候,赛道上有很多公司;到了今天,可能只有极少数生存下来。当时我们叫“自动驾驶”,现在有了一个新名字——“物理 AI”。今天我想跟大家分享的,就是我们走过这一段孤独之旅后的一些心得。
站在一个 AI 产品经理的视角来看,AI 本质上是一种新的劳动力。那么这个劳动力应该在什么样的劳动系统里工作?这个系统的经济机制是什么?我认为有三点非常重要:首先是大模型——我们希望投入巨大的固定成本,让它具有差异化能力;其次是场景化——从一个通用的大模型变成具体的场景化产品,此时要求边际成本趋向于零;最后是入口——产品要被调用,需要入口,它可能是一个 Chatbot,也可能是一个 Agent。
但如果变成一个物理 AI 产品,情况就完全不一样了。物理 AI 的大模型毫无疑问仍然需要巨大的训练固定成本,但它跟数字世界有一个本质的不同:数字世界 99 分约等于 100 分,物理世界 99 分等于 0 分。想象一个自动驾驶产品,99 分意味着每 100 天出一次事故——这是任何人都无法接受的。而在这种场景中,数据的获取变得极其困难,100 天才有一次有价值的数据;反馈同样难以获得——100 天中有 99 天没有出事故,系统看起来运行良好,但没有反馈就很难做强化学习。

场景化同样变得更难。数字世界的软件可以柔性化、即时化,但对物理 AI 产品而言,定制化极为困难——不同场景中,算法并不能做到完全通用。物理 AI 的入口就更难了。数字世界的 AI 可以在某个地方买一个 API,轻易被调用;但在物理世界,你得把系统装到每一台车里、每一个机器人里,成本极高。这就是一个物理 AI 产品经理面临的实质性挑战。
回到十年之前,我想重新审视我们的一系列选择。这十年,从万人出发到孤独的长跑,我们在每一个时间点都基于假设做商业判断和决策。但今天回头看,每个假设、每个预测都被打脸了。如果再重来一次,我们能不能走一条不同的路?以前走过的路,哪些是对的,哪些又是错的?

“先为不可胜,以待敌之可胜”——竞争的时间维度与空间维度
第一个判断是持久战与速决战的问题。自动驾驶、物理 AI 究竟是一场持久战,还是一场速决战?如果是持久战,创业公司就还有机会;如果是速决战,巨头无限资源投入进去,战争瞬间就结束了。我们的判断是:这是一场持久战。
自动驾驶能力的进化曲线是这样的——达到 99 分相对容易,一大批公司都能达到 99 分。但最后这 1% 极其艰难,它需要 99% 的时间和努力。很多公司没办法走过这最后的 1%。但反过来说,巨头达到 99 分的时候,你也不必着急,因为它同样无法轻易跨越这一段。这给了创业公司时间和空间。

确定了要进入这个赛道,第二个问题就是竞争。起步没有巨头早,钱没有巨头多,人也不比巨头聪明,怎么竞争?我们把“竞争”理解为两个字:一个“竞”,一个“争”。
“竞”是田径赛、马拉松。我们和巨头同时出发,各自在不同的跑道上奔跑。当马拉松跑到 10 公里的时候,有些公司支撑不下去退出了——但这并不是因为巨头对它施加了压力,而是它自己耐力不够。自动驾驶也好,物理 AI 也好,前 15 到 20 年本质上是一个马拉松的过程,这是“竞”。
但当你跑到马拉松的终点,必须换一身衣服去参加“争”。“争”是角斗赛、拳击赛——就这么大一个舞台,你死我活,你要做 last man standing。所以整个创业过程可以理解为:15 到 20 年的马拉松,再加 5 年的角斗赛。但马拉松不能只为苟活,你边跑必须边练出角斗的本领。
回顾老祖宗的智慧,孙子言:“先为不可胜,以待敌之可胜。”你要让自己立于不败之地,敌人可能支撑不到那个时间点,或者他会露出破绽。这是一个非常重要的企业思维模式——不能老盯着竞争对手,要盯着自身发展的目标。我们从《孙子兵法》学到的第一点,就是“不败”。
时间维度之外,空间维度同样需要战略。这里我们从另一位老祖宗那里学到了智慧——诸葛亮的《隆中对》。
什么是《隆中对》?蜀国是三国中较弱的一方,要在竞争中生存下去,就需要一个“荆州加益州”的格局。益州是天险、是粮仓,可以立于不败之地;荆州则是经略中原、图谋天下的必备之地。

《隆中对》的本质,就是想明白如何拥有益州,同时参与荆州。我们把自动驾驶分成乘用车和商用车两个赛道——乘用车是七座以下的小车,商用车是七座以上的巴士、公交车、物流车、环卫车等。映射到这张地图上,乘用车就是“荆州”,太多巨头在这个赛道上厮杀;商用车则是“益州”。一个好的《隆中对》策略,就是短期以益州(商用车)为主,兼顾荆州(乘用车)。乘用车能带来巨大的数据优势,商用车则能产生现金流。如果你有一个平台,短期以商用车为主同时兼顾乘用车,就是在空间维度上完成了《隆中对》的布局。
这里引出《孙子兵法》的第二大精髓——“不战”。不战,就是选择巨头射程之外的一个“益州”,先让自己安身立命。

黄金铲子挖富矿:如何找到你的益州,如何制胜益州?
第三个要思考的问题是:哪里是你的益州?如何制胜益州?
作为一家创业公司,我们在巨头射程之外的边缘起步。但绝大多数创业公司一开始都是手里拿着一把“黄金铲子”——因为很贵,什么地方都去挖一下,因为不知道自己的益州在哪里。这个过程是积累经验的过程,是赚个热闹的过程。你会发现很多创业公司一会儿说跟某个大公司形成了联盟,一会儿在哪里做了一个 PoC,但实际上缺乏变现途径。

关键在于,你要尽快找到一座富矿——因为黄金铲子只配挖富矿。“黄金铲子找富矿”,本质上是一个找 PMF 的过程。这个 M(Market),一定是人又缺又贵、法规允许、社会支持的市场。举个例子,我昨天还在新加坡。新加坡做无人驾驶,巴士和 Robotaxi 面临的社会支持和舆论环境完全不同——新加坡开出租车的都是本地人,你要取代他们的工作,大选就会失去选票;而巴士本身缺司机,且都是外劳,在巴士上做无人驾驶从政策环境到社会支持都会更快落地。
P(Product)这一块主要看两点:一是技术是否接近 100 分——达不到 100 分也要有一套体系来兜底;二是成本——算账能不能算得过来,事故后果是否可控。
PMF 一对上,你就慢慢找到了自己的益州。我们找到的益州,是机场。目前我们是全球唯一能够实现机场大规模无人化运行的公司。

中国前 20 机场中的 15 家、世界前 10 机场中的 3 家已经实现了无人化。根据弗若斯特沙利文(Frost & Sullivan)的报告,我们的市场份额超过 91%。

“先胜后战”:六年打造机场最高安全标准的真无人
在机场可以选择很多场景。大家坐飞机时经常能看到一种车——一个拖头后面拖着六个拖斗,普通人很难驾驶,特别缺人,工作环境也极为恶劣。我们先从这样的产品做起,做到机场真正认可的安全标准和服务水平。
这个过程非常复杂。其中一个必须解决的问题是全天候——在各种恶劣天气下保障无人化运营。几年之前,我们的无人车只能在天气好的时候使用。对客户来说,这意味着一旦出现恶劣天气,就得把人重新找回来开车。所以,解决全天候不停歇运营是一个极其关键的问题。
《孙子兵法》讲:打仗一定是“先胜后战”——先想明白这场仗我一定能胜,然后再打。为什么一定能胜?因为相比竞争对手,哪怕是巨头,你在这个细分领域投入的是十倍以上的人力和资源。2019 年 12 月,我们第一次拿到无人化运营牌照;但真正的大规模运营是到 2023 年。从拿到牌照到大规模运营,经历了差不多三四年时间。这期间有巨量的研发投入——上百个版本、几千个 bug、几百个新功能——这就是一种积累,积累即壁垒。而今天,我们的竞争对手还停留在我们 2019 年的阶段。之所以能够“先胜后战”,是因为我们投入的资源是他们的十倍以上。

但别以为找到了富矿就可以安身立命。更重要的一点是:客户是否真正有满足感?我们常说烧水,烧到 99 度还没开,客户的满足感是不够的。举个例子,无人车开到上货点之后,还得靠人来把后面的拖斗接上。这意味着我们只解决了 A 点到 B 点的驾驶问题,连接拖斗还得靠人——而原来这个活就是司机干的。你并没有本质上去掉人。
所以我们必须做全自动——脱钩、挂钩全部实现无人化,这才真正实现了一个小闭环。接下来还要问:其他环节还需要人吗?充电——我们做了自动充电,车停到位后小门打开,自动充电枪找到充电口插进去。上货和下货——机械臂来搬运行李,更大的货物也能实现自动化对接。全流程的无人,才是真正把水烧到 100 度。

从益州到荆州:全场景通用自动驾驶操作系统
益州做好了,拥有百分之九十几的市场份额,下一步是开拓全球市场。这时候就要思考:我们的荆州在哪里?如何谋略中原?
解决了“黄金铲子挖富矿”的问题之后,下一步要做的是一把“普通铲子”——不再是黄金铲子,性价比足够高,同时什么都能挖。这就回到了我们前面说的逻辑:很大的固定成本加上极小的边际成本,才能做到规模化获取高毛利。

无人驾驶的场景非常多:乘用车、商用车,商用车又分开放场景(物流、巴士、环卫、巡检)和封闭场景(机场、工厂、园区、港口、矿山、农牧)。如果选择某一个场景去做,每个场景都需要巨大投入,机会成本极高——做了一个场景就等于放弃了其他场景。今天有很多自动驾驶公司针对各自的场景做专用的自动驾驶操作系统。
但我们认为,我们的“荆州”不应该是这样。我们试图做的是一个叫 U-Drive 的全场景、通用自动驾驶操作系统,打通不同场景的差异化。小型巴士、中大型巴士、皮卡、轻卡、重卡、集装箱转运车、末端配送、环卫车、巡逻车——所有这些背后,都基于同一个 U-Drive 系统。这个系统也在国家级人工智能竞赛中获得了第一名——高安全、多场景的 L4 级自动驾驶系统。
本质上,用产品经理的话说,这就是平台化。平台化在商业上具有巨大的合理性。打一个比方:就像自动烤架,如果一次只烤一根串,烤上几年你可能就饿死了;你要做的是一个烤架同时烤很多根串,找出其中的不变性。商业上的合理性就在于:巨大的固定成本被多个场景分摊。

过去十年,我们一直在三个维度上努力。第一个维度是不断抬高安全下限——出现任何问题,保险丝烧了、刹车延迟、坡上溜坡、手刹拉不上,都要能兜底。第二个维度是不断延伸场景广度——要求算法足够泛化,软硬件平台化,工具链能够帮助快速场景化。即使没有柔性的软件,也要有柔性的工具链。第三个维度是不断抬高技术上限——处理更多复杂场景,同时兼具安全、高效和舒适性,全生命周期的运营运维成本做到足够低。

适逢其时:从感知到世界模型,技术路线万流归宗
最近几年,我们一直在突破技术上限,攀登技术颠覆的高峰。
我觉得这几年我们特别幸运的一点是:具身智能的技术路线已经逐渐清晰。而这些路线其实我们人类并不陌生——在人的智能成长过程中,它们都会得到应用。婴幼儿时期摸爬滚打,摔了哭、爬好了笑,这是强化学习;到了幼儿园,老师家长教你、你跟着做,这是端到端模仿学习;上了小学,开始系统性学习知识,有了专家系统,形成了大模型;进入具体行业后,工匠精神越做越极致,又是强化学习。而贯穿始终的,是一个世界模型——我们从纯数据驱动的归纳法,走向了演绎法。

从 2016 年到 2026 年,技术演进的脉络非常清晰:一开始解决感知问题,感知从 2D bounding box 到 3D,再用 occupancy 解决非标物体的识别,从单个摄像头变成 BEV(6 个摄像头的 bird‘s eye view),从单张照片变成连续视频,实现感知数据闭环。然后我们发现,感知变成了神经网络,规划控制也可以成为神经网络——原来感知和规划控制之间丢失了太多信息,所以需要端到端。接着我们发现感知并不等于理解,于是引入了语言部分——VLM/VLA。再往后,端到端本质上是模仿学习,模仿人还不够好,要超越人,于是引入强化学习。到最后,规则是不能穷尽的——自动驾驶的终点不是“车不撞人”,而是 AI 在物理世界中学会和不确定性共存。世界模型变得越来越重要。

未来几年,技术路线会逐步收敛。而这个收敛过程,恰恰跟人学开车的过程非常类似。18 岁之前建立的社会认知和阅历,相当于预训练的大模型;驾校教练教学的过程是 SFT 微调;新手上路是强化学习(RLHF);熟练之后不动脑子开车、本能地开车、一边听音乐一边开车,这是端到端模仿学习;认真开车是世界模型加 VLA;超级车手则是世界模型加强化学习。非常幸运的是,我们探索到一半的时候,技术路线成熟了,给我们打开了窗口。

不造车,不运营,为你开十年车——AI 司机订阅模式与“看十想五定三”
最后要考虑的是商业模式。今天行业里常见的做法是卖车加维保服务,但未来 AI 的商业模式一定不同。我们希望做的,是在大量的车里嵌入我们的系统——这是我们的物理 AI 入口——然后叠加 AI 司机的订阅模式。
我们会变成一种很轻的模式:不造车,不运营,为客户开十年车。订阅服务一卖就是十年。
进入一个物理入口并不容易,但一旦进入之后被替换也同样不容易。这里面最难商品化的东西是信赖——你要建立的是一个非常可靠的 AI 司机。一旦具备了这种可商品化的信任,替换成本就变得极高。所以我们在生态上采取“π 模型”:这一横是我们的 AI 司机,它会跟各类车、各类机械车型做认证——必须达到 L4 要求的车型才能装载我们的 AI 司机。认证之后预装,成本价销售;然后带着 AI 司机的车到各行各业的集成商、方案商、运营商那里现场部署。因为我们的 AI 司机连接着云端,所以可以 Pay-as-you-go——按月、按年、按里程、按时长收费,形成完整的订阅模式。

当然,这个过程远没有说起来那么简单。赋能 OEM 是一个极其复杂的流程,涉及上百个文档、上百个测试用例集,这本身就是一种积累。
有了前面这些思考,我们的战略叫“看十想五定三”。未来三年,成为世界机场无人驾驶之王;五年,成为世界商用车无人驾驶龙头,乘用车技术也在持续发展;十年之后,这个世界将进入新劳动力经济——我们会变成一家劳务派遣公司,大量的 AI 司机和新劳动力进入千家万户。

基因改造:AI Native 组织与“造父”Coding Harness 平台
最后说一说 AI Native 对我们的帮助。
要实现规模化的订阅模式,每个阶段都有巨大的工作量:开发阶段要做到低成本设计,必须平台化、标准化;部署阶段要实现快速定制化、开箱交付;运营阶段要做到数据驱动运维,最小化成本、最大化可用性——所谓可用性,就是随时保证一百台车可用。在全生命周期中,AI 都在发挥巨大的作用,提升各个环节的效率。
为此,我们正在做企业的“基因改造”,主要有几个方面:
第一,AI First。任何事情的第一个思考就是:能不能用 AI 做?能不能让 AI 自闭环?为此我们给员工提供最好的模型和几乎无限的 token。
第二,确保一切 AI Readable。企业里的大小事情都要记住两个词:一个是 Context(上下文),一个是 Feedback(反馈)。只有不断提供 Feedback,才能通过强化学习让 AI 做得更好。
第三,建立企业运营的世界模型和知识库。什么是企业运营的世界模型?本质上就是老板的智能助手——过去一周开了多少会?有哪些必须知道的重要事项?销售 pipeline 中哪些订单有风险?优秀人才中哪些可能要离职?哪些人在真正埋头解决硬骨头问题,哪些人只是在抢风头?这就是世界模型。还有知识库——一个好的知识库意味着新人来了可以立刻上岗,旧人走了不需要太多时间做交接。
第四,整个组织和流程面向 Agent 优化,最小化沟通和协作成本。我们的目标是 AI 编程占比达到 95%,个人和组织的杠杆率达到六倍以上。所谓六倍——人一天只能工作 12 个小时,如果你同时开三个 Agent,它们一天工作 24 小时,你就能产出 72 小时的成果。
在这个过程中,我们开发了一个工具叫“造父”。造父是中国古代一位伟大的驭手——我们公司叫“驭势”,“驭”就是 Harness。这个工具的出发点不是让 AI 写代码,而是让 AI 做持续的端到端闭环交付。
它从定义目标开始——由 IM 驱动多 Agent 生成 PRD;然后通过 Harness 把任务分解,形成多 Agent 的执行环境;通过 Loop 工程不断进行观察、诊断、行动、验证、恢复,推动交付前进。它支持三种工作流:PRD(从头开发一个产品)、Issue(修复 Bug 或临时加入新功能)、Refactor(对已有系统进行重构)。同时持续追踪,保证可观测性。整套系统是 AI Native 的——由 IM 驱动多 Agent 讨论,再自动生成 PRD。
我们已经把“造父”开源到了 GitHub 上,非常欢迎大家去尝试,一起把从代码编写到端到端交付的工具链做得更好。
GitHub 地址:https://github.com/uisee-ai/zaofu

长跑者要掌握自己的节奏:不追风口,不惧孤独,在奇点后面造桥
最后做一个总结。物理世界的 AI,是一场孤独的长跑。
“驾驭”这两个字很有意思——“驾”是骑马时不断加速,“驭”则是控制节奏。真正的长跑需要控制节奏,不能追风口,也不能怕孤独,专注于把每一步走好。
今天所有人都在谈奇点。但真正改变世界的人,不是在追逐奇点,而是看到奇点前面需要走一条什么样的路、需要造一座什么样的桥——然后真正把这座桥造好。
谢谢大家!
文章来自于微信公众号 “CSDN”,作者 “CSDN”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner