音频转录专家技能 - 使用LLM集成将音频录音转换为专业的Markdown文档,并生成智能摘要。支持会议记录、访谈、讲座等多种场景的音频转文字处理。
技能概述
audio-transcriber 技能是一个强大的音频转文字技能,能够自动将音频/视频文件转换为结构化的Markdown文档。该技能使用Faster-Whisper或Whisper引擎进行转录,零配置即可工作,无需硬编码路径或API密钥。它不仅提供准确的文字转录,还能提取丰富的技术元数据(说话人、时间戳、语言、文件大小、时长),并生成结构化的会议纪要和执行摘要。
下载地址:https://github.com/sickn33/antigravity-awesome-skills/tree/main/skills/audio-transcriber
主要功能
- 音频转文字:将音频/视频文件准确转录为文本
- 说话人识别:自动识别和区分不同说话人(说话人分离)
- 会议纪要生成:自动从录音生成结构化的会议纪要
- 执行摘要:使用AI生成音频内容的智能摘要
- 多格式输出:支持Markdown、SRT、VTT、JSON等多种格式
- 元数据提取:自动提取文件大小、时长、语言等信息
- 批量处理:支持批量处理多个音频文件
- 多语言支持:支持多种语言的音频转录
触发条件
在以下情况下应该调用此技能:
- 用户需要将音频/视频文件转录为文本
- 用户想要从录音自动生成会议纪要
- 用户需要在对话中进行说话人识别(说话人分离)
- 用户需要字幕/字幕文件(SRT、VTT格式)
- 用户想要长音频内容的执行摘要
- 用户询问"转录此音频"、"将音频转换为文本"、"从录音生成会议笔记"等
- 用户有常见格式的音频文件(MP3、WAV、M4A、OGG、FLAC、WEBM)
使用场景
场景1:会议记录自动化
将会议录音自动转换为结构化的会议纪要,包括参与者、讨论主题、决策和行动项。
场景2:访谈内容整理
将访谈录音转录为文字,并生成摘要和关键要点,便于后续分析和引用。
场景3:讲座/培训记录
将讲座或培训录音转换为文档,方便学员复习和知识传播。
场景4:内容创作
将播客、视频等内容转录为文字,用于博客文章、社交媒体等二次创作。
工作流程
步骤0:工具发现(自动检测转录工具)
自动检测系统中安装的转录引擎,优先使用Faster-Whisper(速度快4-5倍),回退到原始Whisper。
# 检查 Faster-Whisper(优先 - 快4-5倍)
if python3 -c "import faster_whisper" 2>/dev/null; then
TRANSCRIBER="faster-whisper"
echo "✅ Faster-Whisper detected (optimized)"
# 回退到原始 Whisper
elif python3 -c "import whisper" 2>/dev/null; then
TRANSCRIBER="whisper"
echo "✅ OpenAI Whisper detected"
else
TRANSCRIBER="none"
echo "⚠️ No transcription tool found"
fi
步骤1:验证音频文件
验证文件存在、检查格式并提取元数据。
- 接受本地文件路径或URL
- 验证文件存在性
- 提取文件大小、时长、格式等元数据
- 检查文件大小(大文件警告)
- 验证格式支持(MP3、WAV、M4A、OGG、FLAC、WEBM)
步骤2:执行转录
使用检测到的转录引擎执行音频转文字操作,支持说话人分离和时间戳。
步骤3:生成Markdown输出
创建包含元数据、转录内容、会议纪要和摘要的结构化Markdown文档。
步骤4:LLM处理(可选)
使用AI模型(Claude/GPT)进行智能摘要和会议纪要生成。
步骤5:显示结果摘要
显示完成状态和后续步骤建议。
输出格式
Markdown报告结构
# Audio Transcription Report
## 📊 Metadata
| Field | Value |
|-------|-------|
| **File Name** | meeting-2026-02-02.mp3 |
| **File Size** | 12.3 MB |
| **Duration** | 00:45:32 |
| **Language** | Portuguese (pt-BR) |
| **Processed Date** | 2026-02-02 14:30:45 |
| **Speakers Identified** | 4 |
| **Transcription Engine** | faster-whisper (model: large-v3) |## 📋 Meeting Minutes
### Participants
- Speaker 1
- Speaker 2
- Speaker 3
- Speaker 4### Topics Discussed
1. **Project Timeline** (00:05:23)
- Q1 milestones review
- Resource allocation discussion
2. **Budget Approval** (00:15:45)
- Approved $50K for new equipment### Decisions Made
- ✅ Approved Q1 project plan
- ✅ Budget allocated for new hires### Action Items
- [ ] **Submit final report**
- Assigned to: Speaker 1
- Due: 2026-02-10
- [ ] **Schedule follow-up meeting**
- Assigned to: Speaker 2## 📝 Executive Summary
[AI-generated summary of key points]## 📄 Full Transcription
[Complete transcription with timestamps and speaker labels]
使用示例
示例1:基本转录
# 用户输入
copilot> transcribe audio to markdown: meeting-2026-02-02.mp3# 技能输出
✅ Faster-Whisper detected (optimized)
✅ ffmpeg available (format conversion enabled)📂 File: meeting-2026-02-02.mp3
📊 Size: 12.3 MB
⏱️ Duration: 00:45:32
🎙️ Processing... [████████████████████] 100%✅ Language detected: Portuguese (pt-BR)
👥 Speakers identified: 4📝 Generating Markdown output...
✅ Transcription Complete!
📊 Results:
File: meeting-2026-02-02.md
Language: pt-BR
Duration: 00:45:32
Speakers: 4
Words: 6,842
Processing time: 127s📝 Generated:
- meeting-2026-02-02.md (Markdown report)🎯 Next steps:
1. Review meeting minutes and action items
2. Share report with participants
3. Track action items to completion
示例2:批量处理
# 用户输入
copilot> transcribe these audios: recordings/*.mp3# 技能将处理所有匹配的音频文件
支持的音频格式
- MP3:最常见的音频格式
- WAV:无损音频格式
- M4A:Apple音频格式
- OGG:开源音频格式
- FLAC:无损压缩音频
- WEBM:Web媒体格式
- MP4:视频文件(提取音频)
转录引擎
| 引擎 | 特点 | 速度 |
|---|---|---|
| Faster-Whisper | 优化版本,推荐使用 | 快4-5倍 |
| OpenAI Whisper | 原始版本,稳定可靠 | 标准速度 |
安装要求
推荐安装:
# 推荐(最快)
pip install faster-whisper# 替代方案(原始版本)
pip install openai-whisper# 可选(格式转换)
brew install ffmpeg # macOS
apt install ffmpeg # Linux
输入要求
使用此技能时,需要提供:
- 音频或视频文件路径(本地文件或URL)
- 可选:自定义提示词(用于定制输出格式)
- 可选:输出格式偏好(Markdown、SRT、VTT等)
输出说明
技能将提供:
- 完整的Markdown转录报告
- 结构化的会议纪要(参与者、主题、决策、行动项)
- AI生成的执行摘要
- 完整的转录文本(带时间戳和说话人标签)
- 可选:SRT/VTT字幕文件
- 可选:JSON格式的结构化数据
最佳实践
- 音频质量:使用高质量的录音以获得最佳转录效果
- 文件大小:大文件(>25MB)处理时间较长,建议分割
- 格式转换:安装ffmpeg以支持更多音频格式
- 说话人分离:清晰的录音有助于准确识别不同说话人
- 审核输出:转录后审核会议纪要和行动项的准确性
- 隐私保护:处理敏感内容时注意数据安全
相关标签
audio transcription whisper meeting-minutes speech-to-text
限制说明
- 仅当任务明确符合上述范围时使用此技能
- 转录准确性取决于音频质量和背景噪音
- 说话人分离功能需要相对清晰的录音
- 大文件处理可能需要较长时间
- 如果缺少所需的输入或工具,请停止并寻求澄清