K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

artbyjazi/autoclip

50PythonMIT

把长视频丢进去,自动剪出带字幕、竖屏、跟踪说话人的成片开源工具

AutoClip接收YouTube链接或视频文件,先把语音转成文字,再用AI语言模型找出值得剪辑的精彩片段,把画面裁成竖屏并跟踪当前说话的人,烧录动态字幕,最终导出可直接发布的MP4视频。它既可以完全离线运行,靠Whisper做语音转文字、Ollama做本地语言模型,也可以接入外部API密钥以获得更好的选段效果。项目目前还处于1.0之前的阶段,画面重构裁剪的质量还没有针对固定测试视频集完成验证。

它做什么

  1. 输入一段长视频后,系统自动完成语音转文字、用语言模型挑选精彩片段、把画面裁剪为竖屏并跟踪正在说话的人、烧录动态字幕、导出成品视频这一整套流程。
  2. 完全本地模式使用Whisper语音识别模型和本地运行AI模型的Ollama,视频和音频完全不会离开本机;若改用外部API密钥,也只会发送文字转录内容,绝不发送视频或音频本身。
  3. 画面裁剪会先检测镜头切换点,对每个镜头单独取景,避免跨越剪辑点平移穿帮;精彩片段的具体时间点是从实际测量的逐词时间戳中查找得到,而不是让AI模型自己计算数字,因为语言模型做算术不可靠、但抄写看到的数字很可靠。
  4. 支持四种字幕样式(粗体弹出式、卡拉OK式逐字填色、简洁下三分之一字幕、高对比度色块字幕)和三种输出画面比例,网页界面和命令行工具功能一致。
  5. 已经在真实的人物访谈类视频上完整跑通全流程并验证,但画面重构裁剪的正式质量标准——无明显抖动、人脸不被裁掉、说话人至少95%的说话时间内出现在画面中——尚未针对三个固定基准视频完成验证,这是项目发布首个正式版本前必须通过的一道关卡。

为什么重要

对内容创作者和营销人员来说,这意味着可以在不上传视频到任何服务器、不订阅付费服务、不用注册账号的情况下,把长视频剪成短视频,这对处理隐私内容或未公开素材的人尤其重要。完全本地运行也省去了反复剪辑产生的API调用费用。

本仓库术语

  • Whisper · 一款开源语音转文字模型,能把说话内容转换成文本
  • Ollama · 一个可以在自己电脑上直接运行AI语言模型的工具
  • LLM · 大语言模型,一种能理解和生成文本的AI系统
  • diarization(说话人分离) · 在多人对话的音频中判断谁在什么时候说话的技术
  • libass · 用于把字幕永久烧录进视频画面的软件组件

仓库简介(英文)

Open-source, local-first AI video clipper. Long video in, caption-burned speaker-tracked 9:16 clips out. Fully offline with Whisper + Ollama, or bring your own API key.

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道