K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

Commonwealth-Bank-of-Australia/project-echo

7PythonMIT

澳大利亚联邦银行开源了一套流水线,把老旧VHS录像带内容变成可搜索的AI标注文本

澳大利亚联邦银行(Commonwealth Bank of Australia, CBA)保存着超过一百年的档案影像,其中不少存在正在老化的VHS、Betamax等磁带上,正在被逐一数字化,但内容本身却难以检索。为此CBA开源了Project ECHO,用语音转文字模型转录音频,再用多模态视觉语言模型(VLM)为视频中的关键画面生成场景描述,让这些档案变得可搜索。该仓库明确说明仅用于研究、教育和社区目的,并不代表CBA实际生产系统。

它做什么

  1. 构建了一套流水线,在磁带(VHS、Betamax等)数字化的同时,把其中的语音和画面内容转成可搜索的文本
  2. 用兼容Whisper的语音识别服务转录音频,用ffmpeg检测场景切换并抽取代表性关键帧,再用视觉语言模型(VLM)描述这些画面,还可选用大语言模型把转录文字和画面描述汇总成一段叙述性摘要
  3. 存储后端(本地文件或S3)和数据库后端(SQLite或DynamoDB)可以独立配置,因此既能在普通笔记本电脑上跑,也能部署到生产级基础设施
  4. 不仅支持OpenAI自身的接口,也能接入自托管的vLLM等任何兼容OpenAI格式的服务端;处理结果始终写入数据库,也可选择同时另存为文本文件
  5. 提供一个可选的“聚簇感知”场景检测功能,把短时间内连续发生的多次场景切换(比如正式内容前突然闪过的字幕画面)归为一组,一次性生成综合描述,避免描述到错误的画面

为什么重要

这展示了一个把濒临损坏的大型档案数字化、同时让其内容变得可检索的实际案例,而不只是简单地保存文件。将语音识别与视觉语言模型结合用于档案自动索引的做法,对任何拥有大量难以检索视频资料的机构、广播公司或图书馆都有参考价值。

本仓库术语

  • VLM(视觉语言模型) · 能够看图并用文字描述图像内容的多模态AI模型
  • Whisper · 一种能把语音转成文字的语音识别AI模型
  • vLLM · 一款用于高效部署和运行AI模型的开源工具
  • ffmpeg · 广泛使用的开源音视频剪辑转换工具
  • DynamoDB · 亚马逊提供的云数据库服务

仓库简介(英文)

Codebase for Project ECHO: Video Transcription and Annotation Pipeline

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道