【研发类-后端开发Skills】audio-transcriber 技能
2026/9/16 10:01:21 网站建设 项目流程

音频转录专家技能 - 使用LLM集成将音频录音转换为专业的Markdown文档,并生成智能摘要。支持会议记录、访谈、讲座等多种场景的音频转文字处理。

技能概述

audio-transcriber 技能是一个强大的音频转文字技能,能够自动将音频/视频文件转换为结构化的Markdown文档。该技能使用Faster-Whisper或Whisper引擎进行转录,零配置即可工作,无需硬编码路径或API密钥。它不仅提供准确的文字转录,还能提取丰富的技术元数据(说话人、时间戳、语言、文件大小、时长),并生成结构化的会议纪要和执行摘要。

下载地址:https://github.com/sickn33/antigravity-awesome-skills/tree/main/skills/audio-transcriber

主要功能

  • 音频转文字:将音频/视频文件准确转录为文本
  • 说话人识别:自动识别和区分不同说话人(说话人分离)
  • 会议纪要生成:自动从录音生成结构化的会议纪要
  • 执行摘要:使用AI生成音频内容的智能摘要
  • 多格式输出:支持Markdown、SRT、VTT、JSON等多种格式
  • 元数据提取:自动提取文件大小、时长、语言等信息
  • 批量处理:支持批量处理多个音频文件
  • 多语言支持:支持多种语言的音频转录

触发条件

在以下情况下应该调用此技能:

  • 用户需要将音频/视频文件转录为文本
  • 用户想要从录音自动生成会议纪要
  • 用户需要在对话中进行说话人识别(说话人分离)
  • 用户需要字幕/字幕文件(SRT、VTT格式)
  • 用户想要长音频内容的执行摘要
  • 用户询问"转录此音频"、"将音频转换为文本"、"从录音生成会议笔记"等
  • 用户有常见格式的音频文件(MP3、WAV、M4A、OGG、FLAC、WEBM)

使用场景

场景1:会议记录自动化

将会议录音自动转换为结构化的会议纪要,包括参与者、讨论主题、决策和行动项。

场景2:访谈内容整理

将访谈录音转录为文字,并生成摘要和关键要点,便于后续分析和引用。

场景3:讲座/培训记录

将讲座或培训录音转换为文档,方便学员复习和知识传播。

场景4:内容创作

将播客、视频等内容转录为文字,用于博客文章、社交媒体等二次创作。

工作流程

步骤0:工具发现(自动检测转录工具)

自动检测系统中安装的转录引擎,优先使用Faster-Whisper(速度快4-5倍),回退到原始Whisper。

# 检查 Faster-Whisper(优先 - 快4-5倍)
if python3 -c "import faster_whisper" 2>/dev/null; then
TRANSCRIBER="faster-whisper"
echo "✅ Faster-Whisper detected (optimized)"
# 回退到原始 Whisper
elif python3 -c "import whisper" 2>/dev/null; then
TRANSCRIBER="whisper"
echo "✅ OpenAI Whisper detected"
else
TRANSCRIBER="none"
echo "⚠️ No transcription tool found"
fi

步骤1:验证音频文件

验证文件存在、检查格式并提取元数据。

  • 接受本地文件路径或URL
  • 验证文件存在性
  • 提取文件大小、时长、格式等元数据
  • 检查文件大小(大文件警告)
  • 验证格式支持(MP3、WAV、M4A、OGG、FLAC、WEBM)

步骤2:执行转录

使用检测到的转录引擎执行音频转文字操作,支持说话人分离和时间戳。

步骤3:生成Markdown输出

创建包含元数据、转录内容、会议纪要和摘要的结构化Markdown文档。

步骤4:LLM处理(可选)

使用AI模型(Claude/GPT)进行智能摘要和会议纪要生成。

步骤5:显示结果摘要

显示完成状态和后续步骤建议。

输出格式

Markdown报告结构

# Audio Transcription Report

## 📊 Metadata

| Field | Value |
|-------|-------|
| **File Name** | meeting-2026-02-02.mp3 |
| **File Size** | 12.3 MB |
| **Duration** | 00:45:32 |
| **Language** | Portuguese (pt-BR) |
| **Processed Date** | 2026-02-02 14:30:45 |
| **Speakers Identified** | 4 |
| **Transcription Engine** | faster-whisper (model: large-v3) |

## 📋 Meeting Minutes

### Participants
- Speaker 1
- Speaker 2
- Speaker 3
- Speaker 4

### Topics Discussed
1. **Project Timeline** (00:05:23)
- Q1 milestones review
- Resource allocation discussion
2. **Budget Approval** (00:15:45)
- Approved $50K for new equipment

### Decisions Made
- ✅ Approved Q1 project plan
- ✅ Budget allocated for new hires

### Action Items
- [ ] **Submit final report**
- Assigned to: Speaker 1
- Due: 2026-02-10
- [ ] **Schedule follow-up meeting**
- Assigned to: Speaker 2

## 📝 Executive Summary
[AI-generated summary of key points]

## 📄 Full Transcription
[Complete transcription with timestamps and speaker labels]

使用示例

示例1:基本转录

# 用户输入
copilot> transcribe audio to markdown: meeting-2026-02-02.mp3

# 技能输出
✅ Faster-Whisper detected (optimized)
✅ ffmpeg available (format conversion enabled)

📂 File: meeting-2026-02-02.mp3
📊 Size: 12.3 MB
⏱️ Duration: 00:45:32
🎙️ Processing... [████████████████████] 100%

✅ Language detected: Portuguese (pt-BR)
👥 Speakers identified: 4

📝 Generating Markdown output...

✅ Transcription Complete!

📊 Results:
File: meeting-2026-02-02.md
Language: pt-BR
Duration: 00:45:32
Speakers: 4
Words: 6,842
Processing time: 127s

📝 Generated:
- meeting-2026-02-02.md (Markdown report)

🎯 Next steps:
1. Review meeting minutes and action items
2. Share report with participants
3. Track action items to completion

示例2:批量处理

# 用户输入
copilot> transcribe these audios: recordings/*.mp3

# 技能将处理所有匹配的音频文件

支持的音频格式

  • MP3:最常见的音频格式
  • WAV:无损音频格式
  • M4A:Apple音频格式
  • OGG:开源音频格式
  • FLAC:无损压缩音频
  • WEBM:Web媒体格式
  • MP4:视频文件(提取音频)

转录引擎

引擎特点速度
Faster-Whisper优化版本,推荐使用快4-5倍
OpenAI Whisper原始版本,稳定可靠标准速度

安装要求

推荐安装:

# 推荐(最快)
pip install faster-whisper

# 替代方案(原始版本)
pip install openai-whisper

# 可选(格式转换)
brew install ffmpeg # macOS
apt install ffmpeg # Linux

输入要求

使用此技能时,需要提供:

  • 音频或视频文件路径(本地文件或URL)
  • 可选:自定义提示词(用于定制输出格式)
  • 可选:输出格式偏好(Markdown、SRT、VTT等)

输出说明

技能将提供:

  • 完整的Markdown转录报告
  • 结构化的会议纪要(参与者、主题、决策、行动项)
  • AI生成的执行摘要
  • 完整的转录文本(带时间戳和说话人标签)
  • 可选:SRT/VTT字幕文件
  • 可选:JSON格式的结构化数据

最佳实践

  1. 音频质量:使用高质量的录音以获得最佳转录效果
  2. 文件大小:大文件(>25MB)处理时间较长,建议分割
  3. 格式转换:安装ffmpeg以支持更多音频格式
  4. 说话人分离:清晰的录音有助于准确识别不同说话人
  5. 审核输出:转录后审核会议纪要和行动项的准确性
  6. 隐私保护:处理敏感内容时注意数据安全

相关标签

audio transcription whisper meeting-minutes speech-to-text

限制说明

  • 仅当任务明确符合上述范围时使用此技能
  • 转录准确性取决于音频质量和背景噪音
  • 说话人分离功能需要相对清晰的录音
  • 大文件处理可能需要较长时间
  • 如果缺少所需的输入或工具,请停止并寻求澄清

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询