Commonwealth-Bank-of-Australia/project-echo
澳大利亚联邦银行开源了一套流水线,把老旧VHS录像带内容变成可搜索的AI标注文本
澳大利亚联邦银行(Commonwealth Bank of Australia, CBA)保存着超过一百年的档案影像,其中不少存在正在老化的VHS、Betamax等磁带上,正在被逐一数字化,但内容本身却难以检索。为此CBA开源了Project ECHO,用语音转文字模型转录音频,再用多模态视觉语言模型(VLM)为视频中的关键画面生成场景描述,让这些档案变得可搜索。该仓库明确说明仅用于研究、教育和社区目的,并不代表CBA实际生产系统。
它做什么
- 构建了一套流水线,在磁带(VHS、Betamax等)数字化的同时,把其中的语音和画面内容转成可搜索的文本
- 用兼容Whisper的语音识别服务转录音频,用ffmpeg检测场景切换并抽取代表性关键帧,再用视觉语言模型(VLM)描述这些画面,还可选用大语言模型把转录文字和画面描述汇总成一段叙述性摘要
- 存储后端(本地文件或S3)和数据库后端(SQLite或DynamoDB)可以独立配置,因此既能在普通笔记本电脑上跑,也能部署到生产级基础设施
- 不仅支持OpenAI自身的接口,也能接入自托管的vLLM等任何兼容OpenAI格式的服务端;处理结果始终写入数据库,也可选择同时另存为文本文件
- 提供一个可选的“聚簇感知”场景检测功能,把短时间内连续发生的多次场景切换(比如正式内容前突然闪过的字幕画面)归为一组,一次性生成综合描述,避免描述到错误的画面
为什么重要
这展示了一个把濒临损坏的大型档案数字化、同时让其内容变得可检索的实际案例,而不只是简单地保存文件。将语音识别与视觉语言模型结合用于档案自动索引的做法,对任何拥有大量难以检索视频资料的机构、广播公司或图书馆都有参考价值。
本仓库术语
- VLM(视觉语言模型) · 能够看图并用文字描述图像内容的多模态AI模型
- Whisper · 一种能把语音转成文字的语音识别AI模型
- vLLM · 一款用于高效部署和运行AI模型的开源工具
- ffmpeg · 广泛使用的开源音视频剪辑转换工具
- DynamoDB · 亚马逊提供的云数据库服务
仓库简介(英文)
Codebase for Project ECHO: Video Transcription and Annotation Pipeline
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库