artbyjazi/autoclip
把长视频丢进去,自动剪出带字幕、竖屏、跟踪说话人的成片开源工具
AutoClip接收YouTube链接或视频文件,先把语音转成文字,再用AI语言模型找出值得剪辑的精彩片段,把画面裁成竖屏并跟踪当前说话的人,烧录动态字幕,最终导出可直接发布的MP4视频。它既可以完全离线运行,靠Whisper做语音转文字、Ollama做本地语言模型,也可以接入外部API密钥以获得更好的选段效果。项目目前还处于1.0之前的阶段,画面重构裁剪的质量还没有针对固定测试视频集完成验证。
它做什么
- 输入一段长视频后,系统自动完成语音转文字、用语言模型挑选精彩片段、把画面裁剪为竖屏并跟踪正在说话的人、烧录动态字幕、导出成品视频这一整套流程。
- 完全本地模式使用Whisper语音识别模型和本地运行AI模型的Ollama,视频和音频完全不会离开本机;若改用外部API密钥,也只会发送文字转录内容,绝不发送视频或音频本身。
- 画面裁剪会先检测镜头切换点,对每个镜头单独取景,避免跨越剪辑点平移穿帮;精彩片段的具体时间点是从实际测量的逐词时间戳中查找得到,而不是让AI模型自己计算数字,因为语言模型做算术不可靠、但抄写看到的数字很可靠。
- 支持四种字幕样式(粗体弹出式、卡拉OK式逐字填色、简洁下三分之一字幕、高对比度色块字幕)和三种输出画面比例,网页界面和命令行工具功能一致。
- 已经在真实的人物访谈类视频上完整跑通全流程并验证,但画面重构裁剪的正式质量标准——无明显抖动、人脸不被裁掉、说话人至少95%的说话时间内出现在画面中——尚未针对三个固定基准视频完成验证,这是项目发布首个正式版本前必须通过的一道关卡。
为什么重要
对内容创作者和营销人员来说,这意味着可以在不上传视频到任何服务器、不订阅付费服务、不用注册账号的情况下,把长视频剪成短视频,这对处理隐私内容或未公开素材的人尤其重要。完全本地运行也省去了反复剪辑产生的API调用费用。
本仓库术语
- Whisper · 一款开源语音转文字模型,能把说话内容转换成文本
- Ollama · 一个可以在自己电脑上直接运行AI语言模型的工具
- LLM · 大语言模型,一种能理解和生成文本的AI系统
- diarization(说话人分离) · 在多人对话的音频中判断谁在什么时候说话的技术
- libass · 用于把字幕永久烧录进视频画面的软件组件
仓库简介(英文)
Open-source, local-first AI video clipper. Long video in, caption-burned speaker-tracked 9:16 clips out. Fully offline with Whisper + Ollama, or bring your own API key.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库