深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流
8653点击    2026-07-22 10:35

深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


开始忘记软件以后,创作才真正开始。


三个月前,我第一次体验 LibTV。它更像一套专业的视频制作工具。我花了很多时间理解 Workflow、节点和模型之间如何协作,最后得出的判断是:只要掌握了 LibTV,就能完成过去一个影视团队才能完成的事情。


三个月后,LibTV 上线了 Agent 和 Skill 功能。我决定重新体验一次。


这一次,我给自己设了一个限制:不学习任何功能,不切换任何面板,全程只和 Agent 对话,来做出 AI 视频。


做到第三个 Demo 时,我突然意识到,我开始想的,不再是下一步该怎么操作,而是这个故事还能怎么发展。


这时,软件退出了,创作进入了。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


过去大家讨论 AI 视频,总是在讨论它能做到什么,却很少讨论普通人究竟有多大概率做到。


包括三个月前的 LibTV,它让我看见,当我真正掌握这套工具以后,它的上限到底有多高。


可另一面也同样存在。


如果工具越来越多,工作流越来越复杂,我甚至不知道每一种能力应该在什么时候出现,那么再高的天花板,对大多数人来说,它先是一个天花板。


所以这一次,我第一次觉得,LibTV 更新的重点已经不是模型了。


它开始重新组织这些能力,把繁杂的工作流隐去,回归到用自然语言沟通的「片场」。


01

软件退场,创作上场,回到片场


当复杂的工作流退到后台,LibTV Agent 留给创作者的,是一种接近片场的沟通方式。


我不需要先把创作意图翻译成模型、节点和参数,我只需要用自然语言和 Agent 说出我的想法。


这个过程像是在片场,而我就是导演。我不必亲自操作每一台设备,但要持续告诉团队,故事往哪里走,人物怎么演,这个镜头怎么拍……


Skill 带来的第一步,就是快速进入一种熟悉的创作语境。


我最先点开的是首页里的 A24 风格 Skill。A24 式恐怖美学,有一种安静中透着诡异,把噩梦拍成油画的美感。它让我想到今年大火的电影《后室》。但我没有兴趣复刻一条标准的「后室」短片。我更好奇的是,如果把这种空间错位放进中国人的共同记忆里,它会是什么样子。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


于是我想到了中式梦核,以及其中最具体的一类场景:校园。


最初的想法很简单。一个打工人意外掉进了教学楼的走廊里,他在里面漫无目的的穿行。


我没有准备人物设定和故事,只告诉 Agent 大致的氛围、风格和片长,希望它先帮我搭出一个中式「后室」。


接下来,Agent 开始把这个模糊的念头往前推。


它先给出视觉方向,再补充场景组合、人物形象和声音设计。每一步都会提供几套方案,我可以直接选择,也可以推翻它的建议,继续用自己的语言描述。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


创作由此进入一种持续往返的状态,想法变成可见的选项,我再根据选项判断和探索。也正是在这一轮轮沟通中,原本只有氛围的短片开始长出故事。


我突然想到,校园对于打工人来说,真正可怕的地方未必是空间本身,而是那些早已结束、却始终没有彻底离开的高考记忆。


于是,故事又往前走了一步:一个成年人掉回高考现场,他陷入了被一道题困住的噩梦里。


Agent 随着这个变化继续扩展篇幅,空荡的走廊,也开始有了教室、试卷、角色反应。


我的工作逐渐从「提出一个想法」,转向判断这个想法应该长成什么样子。


到这一步,我意识不到自己正在操作一款 AI 视频软件,我更像是在和一支前期筹备的团队沟通,而故事也在这种沟通里,一点点显出轮廓。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

「高考噩梦」的开场


接下来,创作进入了我更熟悉的阶段。


场景氛围对不对,人物该做什么动作,镜头之间能不能接得住?这些问题开始一个个出现。我原本只想做出一种压抑、失真的校园氛围,但当画面真正生成出来以后,很多问题会立刻变得具体。


我开始像坐在监视器前的导演一样,对着每一条镜头提出意见。只不过,我的意见直接输出在 Agent 对话框里。


比如要求镜头分切,剪辑节奏加快,也会因为前后两条素材接不上,重新调整场景顺序。很多判断很难提前写进一份完整的提示词里,它们只有在画面出现后才会发生。


这时,Agent 的作用也开始发生变化,场景之间缺少过渡,它会补充镜头;原来的情节不够完整,它也会尝试扩展前后关系;甚至在我说「差点儿氛围,你懂吗?」这种模棱两可的话后,它都会根据上下文,自己给出几套「增强氛围感」的方案。


这种来回很像真正的创作沟通。我当然一直在指挥它,但它给出的选项也在反过来提醒我:这个故事还可以往哪里走,哪些地方没有想清楚。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

我全程用自然语言,像在片场和团队交流的方式,跟 Agent 一起打磨短片。


AI 独有的低成本的试错能力,也让这些分岔变得很容易。一个方向不成立,可以马上换,某个镜头意外地有效,也可以顺着它继续发展。


在 LibTV Agent 上,创作不再需要等到所有问题都想清楚以后才开始。


我后来又用「对话创作」的方法做了几支完全不同的短片。


一支是基于韦斯·安德森「对称美学」的 skills,这个 skill 让我联想到了《花束般的恋爱》,我用「对称」带来的镜像关系,做了一条想表达「恋爱关系中的自恋投射」的小短片;


一支是用了皮克斯风格 skills,做了一条关于「一个人刷到 AI 视频 Agent 后,瞬间幻想自己靠它起号爆红、财富自由、环游世界。当幻想结束,他带着满足感睡去,仿佛已经完成了这一切,却始终没有迈出第一步。」


另一支则是「一个女孩每天都和自己的狗说心事,直到有一天,狗回应了她。」


每一次的起点都很轻,有时只是一句判断,有时只是一个想法,甚至只是我对某种风格的好奇。


但 Skill 先给出一条可以进入的路径,Agent 再把这条路径往人物、场景和镜头上展开,等我去挑选和修改,作品慢慢长成自己的样子,


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

使用「皮克斯 Skill」做出的 30 秒小短片,想表达「幻想成功,是一种即时满足,即时满足,会杀死真正的行动。」


整个过程中,我几乎都在对着电脑说话。相比打字,语音更接近片场里的工作方式。


因为导演不会先把每一条意见整理成完整指令,再交给演员和摄影师。而是坐在监视器前,直接用对讲机说「这条哪儿不对」。


这种沟通里有犹豫、临时变卦、灵机一动,最重要的是,团队能否理解这些变化。LibTV Agent 就能承接这种上下文。上一轮我们讨论过的人物、场景和镜头,会继续影响下一轮修改。它「看」得懂我在说什么,而不只是听得懂,这是一个完整的视频 Agent 必须拥有的能力。


而这种「判断力」,最集中的体现在某支短片生成后,我没有直接上手改,而是先问 Agent:「你自己看,这支片子还有什么问题?」于是它重新检查了人物动作、镜头连续性和节奏,自己给出一版修正。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

Agent 已经有了自我纠错的能力


当然,视频生成的黑箱没有消失,人物动作、表情和空间关系仍然很难完全控制,改好一处,也可能带出新的错误。这是所有 AI 都解决不了的问题,LibTV 能做的,是尽量把输出质量提高,修改次数降低。说白了,盲盒还在,但抽取的质量更高了。


在我完成了短片 Demo 后缩小画布,我才看见后台发生了什么。故事板、人物资产、声音、镜头节点和生成链路铺满整个页面。刚才所有自然语言的沟通,已经被系统翻译成一套复杂的 Workflow。


这套流程不是我逐个节点搭出来的。它来自前面说过的每一句话,也来自我对人物、场景和镜头的每一次判断。但 Agent 和我共创的全过程里,我只需要盯着一个片段,在对话框里给出我的判断。


所以,创作的复杂性依然存在,只是退出了创作者的视线。我的想法,沿着一条直线抵达成片。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

LibTV Agent 功能在交互上做得最好的一点是:我只需要面对 1~3 个镜头,复杂的面板只有缩放时才会看到。


这就是我使用 LibTV Agent 后,在创作方式上最直接的变化。


三个月前,我需要先研究软件,理解模型、节点和工作流如何组合,再开始创作。现在顺序反了,我可以先进入作品,剩下的组合交给 Agent 在后台完成。


这背后降低的是常常被 AI 行业忽视的「执行成本」。


大模型降低了视频的拍摄成本,解决的是画面能不能做出来,但从一段提示词到一支完整视频,中间仍然隔着人物设定、分镜、模型调用、素材管理、场景搭建等等门槛。


Agent 降低的就是「执行成本」,即创作者到底能不能用简单的方式,做出一条片子。


执行成本下降后,人的工作会变得更集中。我就面对画面做判断,决定人物、镜头和节奏;Agent 负责调用工具,把这些判断继续往下推演。


这也解释了为什么 LibTV 这次把重点放在 Agent 和 Skill 上。模型再多、能力再强,只要用户仍然要先学会复杂的工作流,它们就很难真正进入创作。


三个月前,我看到的是 LibTV 能够容纳多少专业能力。现在,我更在意这些能力能不能主动靠近创作者。


因为模型决定一支视频最终能达到多高,而 Agent 决定一个普通人,有多大概率真正走到那里。


02

影视经验,开始变成一种 Skill 能力


如果说,第一阶段的视频 AI 在竞争模型,那么下一阶段,竞争的或许就是经验。


过去两年,所有人都在讨论模型能力:画质有没有更高,动作是不是更自然,人物能不能保持一致。


但当这些能力越来越接近以后,另一个问题开始浮现:同样的模型,为什么有人能做出电影感,有人却只能做出一段素材?


想理解这里面的差别,可以先看看电影学院到底在教什么。


在电影学院前两年的课程里,老师不会教学生怎么操作摄影机、怎么使用剪辑软件。


而是教拉片和模拟拍摄,学生反复拆解一段电影,甚至 1:1 复刻拍摄一个经典片段。就是为了学习导演为什么这样组织镜头,摄影为什么这样调度,美术为什么这样设计场景,剪辑为什么这样控制节奏。这些能力,很少写在教材里。


一个学过摄影的人,或许几周就能掌握相机的原理。但只有在片场待过足够久,才会知道导演为什么愿意多等十分钟,只为了等到一束「金色时刻」。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流

电影《巴比伦》中就描绘了片场如何全员等待「金色时刻」|图源:《巴比伦》


影视行业真正宝贵的,正是这些长期积累下来的经验。


而 Skill,就把过去只能在片场慢慢积累的经验,变成了一种普通创作者也可以直接借用的能力。


它可以让我快速进入 A24、韦斯·安德森,或者岩井俊二的创作语境。


但更重要的是,它提供的不只是画面风格,而是一条已经被验证过的创作路径。它告诉创作者,这类故事通常怎样组织镜头,这种情绪怎样建立节奏,这种风格怎样展开叙事。我仍然可以修改、推翻、再创作,但已经不用每一次都从零开始。


所以 Skill 不是替我完成创作,也没有把作品限制在一套固定模板里,它更像一个已经搭好的片场,布景、灯光和基本的镜头逻辑已经存在,我可以直接走进去,再决定要在里面拍什么。


对于一个只有模糊想法的人来说,这一步很重要。不知道从哪儿下笔的空白页,常常比工具本身更难面对。


当一种经验能够被反复调用,它带来的就不只是效率,还有重新组合的可能。


过去,一个创作者很难同时拥有广告导演对于节奏的控制、电影导演对于叙事的组织,以及 MV 导演对于视觉风格的处理,因为这些经验分别属于不同的人、不同的团队,也属于不同的行业。


Skill 第一次让我觉得,这些原本彼此独立的经验,可以在一次创作里重新借用。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


我可以借用岩井俊二的美学,去拍一个数码产品的广告;也可以把韦斯·安德森的镜头秩序,与 A24 的诡谲美学放进同一支短片里。


也是到这里,我才慢慢理解,为什么 LibTV 会把 Skill 单独做成一个产品。


模型解决的是生成,Agent 解决的是执行,而 Skill 解决的,是创作经验。


对于没有接受过影视训练的人来说,最大的困难是不知道一种风格应该怎样开始,一段故事应该怎样展开,一个想法应该怎样慢慢长成一支片子。


Skill 把片场经验精炼为可调用的能力,Agent 再把这种能力,通过自然语言真正交到创作者手里。


过去,我们一直在讨论 AI 视频能做到什么。但对于绝大多数潜在创作者来说,更现实的问题始终是:我有没有能力做到。


或许,这才是视频 AI 下一阶段真正的竞争。不只是比谁拥有更强的模型,更丰富的工具,更复杂的面板,而是谁能够让更多人真正开始创作。


03

一个视频,从一句话开始


现在的 LibTV,总让我想到十多年前,智能手机普及后,自媒体时代到来了。


那时候,越来越多人开始习惯举起手机,人们开始拍日常、拍生活、拍观点,也开始拍那些以前觉得」不值得拍」的东西,把它们简单剪辑后传到社交媒体上。后来我们把它叫作自媒体时代。


体验 LibTV Agent 和 Skill 的几天里,我一直有一种兴奋感。那是创作者第一次遇到一种新创作方式时才会有的感觉,就像十多年前,人们第一次举起手机拍视频。


我越来越少去想提示词应该怎么写,而是描述脑子里的想法、画面、节奏、情绪,然后看着它生成 V1、V2、V3……一点点把它改成更接近自己想象的样子。我想把这种过程叫作 Vibe Filming。


深度体验 LibTV Agent:忘记工具,进入 AI 创作的心流


这支小短片就源于我一直有的一个念头:很多人试图找到「世另我」的伴侣,本质上是自恋。


我第一次觉得,这个工具开始推着我创作,而不是等着我操作。


作品的起点,不一定是一套已经完成的剧本、分镜。它可以只是一个画面,一个情绪,一个突然冒出来的念头。


作品的终点,也不一定是大银幕或 AI 电影节。它可能只是一条朋友圈,一条小红书,一条属于你的自我表达。


很多人会说,AI 出来以后,最重要的是有没有好想法。我反而觉得,有没有想法,一直都是创作者自己的命题。真正改变的是,那些原本挡住表达的障碍,随着软件的进化,一层一层消失了。


就像十多年前,智能手机没有让所有人成为创作者,它只是让「不会拍」不再成为理由。我不知道 Vibe Filming 会不会成为下一个 Vibe Coding,LibTV 等工具会不会带来 AI 时代的「新·自媒体」。


但至少,它让我相信,一个作品可以从一句还没想清楚的话开始。


*头图来源:LibTV


文章来自于"极客公园",作者 "Moonshot"。

关键词: AI新闻 , AI视频 , LibTV , LibTV AI
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0