专业软件的门槛正在消失,我们还在用旧的能力边界限制自己吗?2026 年 9 月,GPT-6 Astra 发布,博主猿大侠连测数日,把视频工作全流程交给了 Codex。
2026 年 9 月,GPT-6 Astra 发布,博主猿大侠连测数日,把视频工作全流程交给了 Codex。结论写在一篇万字长文里:过去要打开剪映、Pr、AE、达芬奇才能干的活,它接连干了出来,有些还得开会员。
只给一个片名,27 分钟出片
最能说明问题的是电影解说。他只发了一句话:“请做一个电影解说视频,详细解说《肖申克的救赎》,3 分钟。”不给视频文件,不给素材链接。
Codex 自己查资料核对剧情,找官方预告片和场景片段下载,确定叙事角度,写解说稿,生成中文男声配音,做字幕,合成导出。用时 27 分 22 秒,交付 3 分钟整、1080p 横屏成片,覆盖屋顶啤酒、图书馆、越狱、瑞德与海边重逢,附解说文案和素材来源。
一句简短要求,AI 把找素材到交付成片的整条流程接了起来。
12 类任务实测,全流程打通
其余测试同样有具体数字:
- 下载:苹果官网发布会视频禁止直接下载,9 分 43 秒拿到 4K SDR、1 小时 17 分、4.35 GB 的完整 MP4
- 解说剪辑:1 小时发布会剪成 2 分 25 秒解说片,52 个镜头、55 段字幕;说一句“字幕下的小字不要了”,它回工程里改完重新交付
- 双语字幕:1 小时 17 分视频配出 1678 条中英字幕,还查出原片与官方字幕有 0.975 秒偏移,先校准再烧录
- Keynote 提取:从视频截出 337 页发布会演示页整理成材料包,他以前对着视频一帧帧截图
- Vlog 快剪:和田二街的旅行素材变成 60 秒竖屏短片,21 个镜头,“米饭好好吃”这句现场声做过语音识别核对
- MG 动画:60 秒《什么是 Agent》解释动画,19 个镜头,背后是 Remotion,用 React 写视频,告别逐帧 K 关键帧
注意两点:Codex 不操作剪辑软件界面,靠写代码调用工具完成任务;GPT-6 原生输入目前只有文字和图像,音视频要靠抽帧和转写喂给它。
冷静剂:先别急着全信
文章最有价值的部分是泼冷水。0.975 秒的字幕偏差,看几秒无感,连看一小时难受;Vlog 做过全片解码和画面抽检,但没有人工全片听审;调色对比视频好看,不代表人脸跟踪、局部蒙版、HDR 母版已解决。
他没给“节省 90% 时间”这类数据,因为没做统一对照实验:配环境、修报错、等渲染都是真实成本。
他的判断标准是:原来需要人重复操作的环节,现在能否由 AI 可靠执行,并留下能复查、能修改的结果。
结语:把什么交出去
素材盘点、字幕、初剪、批量导出可以交出去;叙事、节奏、肤色、最后的质感,留在自己手里。
熟练操作依然有价值,但提出目标、组织资源、判断结果,并为最终的作品负责,会占据更重要的位置。工具扩大了行动能力之后,比“Codex 能不能干掉某款软件”更值得追问的是:我们是否还在用过去的能力边界,限制今天的想象。
来源:公众号「猿大侠」·《深度:Codex + GPT-6打通视频处理全流程,干掉剪映、Pr、AE、达芬奇》(2026-09-14)· 阅读原文
说明:本文为提炼式读后整理,版权归原作者所有。
整理 / 哈雷彗星
评论0