AI 时代,会不会技术,已经不再是能不能做好专业事的门槛;门槛变成了——你能不能把一件事拆清楚、讲清楚。今天我把自己刚刚搭建的 AI 视频制作流水线的整个过程和大家做一个分享,希望对大家有所启发。

一、先有一条视频

一切从一条视频开始。素材来自 2026 年 9 月 29 日的 AI 热点:相似报道按事件合并,再挑值得解释的。最终成片七个主题,约三分钟,竖屏 1080×1920,配分段旁白、原创图形页面、翻页动效和固定品牌片尾。

视频封面

这只是我的一个例子。换成历史、教育、科学、亲子、财经、文化、培训或个人经验,都能用同一套思路,做出属于你的那一条。

二、从一条视频,变成一条流水线

单条视频做完了,真正值钱的是把它抽象成一条能重复跑的流水线。制作路径大致是这样:

主题与素材    ↓筛选、核实、确定表达边界    ↓编辑判断 → 结构化脚本 / 分镜    ↓旁白、画面、字幕与声音设计    ↓模板化合成 → 检查 → 渲染    ↓审阅成片、归档、吸收反馈

关键的一步,是把内容、表达、声音、画面和工具接口分层。工具可以换、内容可以换、模板可以换,只要环节之间的约定清楚,下一条就不用从零开始。

这套模板定稿,是整个过程里花时间最多的一步,主要耗在优化样式和交互上:视觉清不清楚、翻页顺不顺、字号放到手机上看舒不舒服。但这段工作几乎全靠对话完成——我把想要的效果用话讲清楚,AI 帮我调整,一行代码都没写。

这也是整件事最反直觉的地方:做出一条有专业感的流水线,靠的是把想法描述清楚,而不是会写程序。

三、这条流水线,我用了哪些工具

这些工具大多是现成的,我只是把它们组合起来:

|

工具

|

承担的工作

|

可替换

|
| --- | --- | --- |
|

Codex

|

梳理需求、组织制作步骤、编写脚本、调用本地工具。编排入口,不替代来源核验和最终审稿。

|

其他 AI 助手、自动化平台或人工

|
|

MyHOT MCP 与热点页

|

获取当天热点和事件线索,去重后定选题。只用于发现议题,不作事实结论。

|

RSS、新闻 API、数据库、搜索、采访、人工

|
|

浏览器与来源原文

|

核对官方公告、研究、法院、媒体报道的事实、时间、归因和争议边界;也看视频预览。

|

其他浏览器、资料库、论文平台、一手材料

|
|

VoiceStudio

|

用"男播音"声线按片头/各条/结尾生成旁白 WAV;声线配置留本机,不外发。

|

其他 TTS、本人录音、配音演员、本地语音模型

|
|

Python 脚本

| generate_voiceover.py

 按分段请求配音并记录时长;build_composition.py 读故事数据和时长,生成页面、音频与时间轴。

|

Node、Shell、剪辑软件的数据驱动模板

|
|

HyperFrames 0.6.46

|

预览、渲染视频并做工程检查;npm run check 检查,npm run render 渲染。

|

其他网页视频框架、非编软件、自建渲染

|
|

HTML/CSS/SVG/GSAP

|

HTML 结构、深蓝科技视觉、可缩放插画、标题/页面/翻页动效。

|

Canvas、Lottie、CSS 动画、视频素材、幻灯片

|
|

本地预览页与成片

|

浏览器预览画面和播放;生成封面海报;MP4、海报、预览页归档。

|

其他播放器、审片工具、团队交付平台

|

连接关系:

MyHOT MCP / 热点页 → Codex 协助筛选与编稿 → 来源原文核对                                      ↓结构化故事数据 → Python 脚本 → VoiceStudio 旁白 WAV                       ↓              ↓                 HTML/CSS/SVG/GSAP + HyperFrames → 检查、预览、渲染

Python 脚本只自动化重复操作,真正决定视频讲什么的是选题、事实边界和编辑判断。

模板定稿后,还可以把它升级成每天自动运行的数字员工:

定时触发   ↓数字员工通过 MCP 获取当天数据   ↓去重、筛选、核对来源并形成解读脚本   ↓按固定模板生成配音、画面、字幕和动效   ↓自动检查内容与成片规格   ↓通过检查 → 发布到微信视频号 → 归档并记录结果   └─ 未通过 → 暂停发布,修复或通知负责人

数字员工按当天内容生成场景、做检查,达到门槛就自动发布并归档,遇到异常就停下通知负责人。新闻、科普、课程不同领域,换掉数据入口和判断规则,流水线结构可以直接复用。

四、专业感来自判断,不只来自工具

流水线帮你干活,但让你显得专业的是判断。一条内容可以拆成三层:

  1. 发生了什么:清楚交代事实或核心知识。

  2. 我们知道到什么程度:交代来源、条件、争议、适用范围或不确定处。

  3. 这意味着什么:解释它与观众、行业或趋势的关系。

本系列对应"事实—边界—观察",课程里是"知识—适用条件—应用价值",人物故事是"经历—时代背景—个人选择"。结构可变,区分证据与解释的意识别丢。介绍模型能力时,厂商数据要归因给厂商;谈诉讼时写清是谁提出了什么请求,不能把诉讼请求说成已生效判决。

专业感还靠一套检查兜底:事实引用是否站得住、画面是否清楚、字幕是否易读、旁白是否自然、画幅和时长是否符合平台、结尾是否完整。渲染成功不等于内容完成了,判断和质量得有人盯着。

五、我把它整理成一份开源的 Skill

我把这套流程打包成了 content-video-pipeline Skill,放在 GitHub 上:

**https://github.com/zj-unicom-ai/UniEmployee/tree/main/backend/skills/content-video-pipeline\*\*

它不绑定我的电脑、某个 MCP 地址、私人声线或特定视频框架。你可以用自己的数据来源、录音方式、视频工具、品牌资产和归档目录;安装前按 README.md 说明,适配自己的主题类型、数据入口、配音工具、渲染器和归档规则。

为什么分享?这套方法要是只留在我自己手里,就只是一条个人的流水线;把它开源,别人就能按自己的数据源、工具和平台,搭出属于自己的数字员工。AI 时代最值得传播的,不是某个成品视频,而是"怎么做出来"这套过程本身。

结语:你也可以

回到开头那句话:我不会技术,照样做了专业的事。因为在 AI 时代,专业不再等于会写代码,而是等于能把一件事想清楚、讲清楚、拆成可复制的环节。

我把自己的过程整理成 Skill 分享出去,就是想让更多人发现:你也可以。把想法变成作品,再把方法变成可分享的东西——这条路,人人都走得通。


💡 万智创界 - AI Native 智能生产力工作室

专注 AI Agent、数字员工与智能自动化, 帮助企业将知识、流程与经验转化为真正可以执行的 AI 能力。