嗯,然后我们当时其实就是觉得这个产品可能用户不太接受。后来大概访谈了二十多个吧,准确说是二十七个。然后发现不是产品本身的问题,是第一次打开以后,用户不知道应该从哪里开始……
HERMES AGENT PROFILE · AUDIO INTELLIGENCE
把一段音视频,变成
可以直接分享的中文提纯稿。
播客转录工具自动识别来源、优先获取字幕、必要时执行语音识别,并保留关键案例、数字、判断链与重要原话,最终交付飞书文档。
正在提纯内容校正术语 · 重建结构 · 保留判断链
72%7 个主题 · 12 条关键判断 · 4 个案例
INTERACTIVE WALKTHROUGH
走一遍播客转录工具的工作过程
选择一个内置案例,观看前端模拟流程。演示不会上传、下载或发送任何数据。
BEFORE / AFTER
不只是摘要,而是提纯
删除噪声,但不删除价值。播客转录工具保留事实、案例、数字与推理过程。
用户拒绝的不是产品,而是过高的理解成本
团队最初将留存率下降归因于产品价值不足,但在访谈 27 位用户后发现,真正的阻力来自首次使用时过高的理解成本。
“用户不是不需要这个产品,而是不知道第一步应该做什么。”
STANDARD OPERATING PROCEDURE
从链接到文档,八步闭环
每一步都有明确的判断条件、工具和完成标准。
确认输入
识别链接、会议 ID 或本地文件,检查访问授权。
判断来源
小宇宙、B站、YouTube、飞书妙记或本地音频。
优先字幕
先找可靠字幕或逐字稿,存在则跳过 ASR。
获取音频
使用 yt-dlp 与 ffmpeg 下载、提取或分段。
语音识别
使用 faster-whisper 完成中文转录。
清洗校正
去时间戳、标签、重复句,并修正常见错词。
结构提纯
按真实话题分段,保留案例、数字与判断链。
飞书交付
创建文档、检查目录与权限、交付可访问链接。
DELIVERY STANDARD
什么才算真正完成?
播客转录工具不以“生成了一段文字”为完成,而以交付一份准确、可读、可访问的分享式提纯稿为完成。
[来源平台]-[原标题]-整理稿-YYYY-MM-DD没有时间戳和说话人标签正文可直接连续阅读
不是“三句话总结”保留关键案例、数字、判断链和重要原话
主要 ASR 错词已修正重点检查人名、公司名、产品名和专业术语
标题来自真实内容拒绝“其他观点”“补充说明”等垃圾桶标题
飞书文档可访问目录结构、链接和协作者权限均已检查
TRUST & BOUNDARIES
能力边界,写在明处
可信的 Agent 不只说明会做什么,也明确说明不会做什么。
✓它可以
- 处理公开播客、公开视频和已授权录音
- 优先提取已有字幕或逐字稿
- 分段处理超过 2 小时的长音频
- 标注无法确认的专有名词
- 创建并交付飞书整理稿
×它不会
- 绕过登录、付费墙或平台访问控制
- 处理未经授权的私密会议
- 发布或传播原始音视频
- 擅自补全不确定的人名与数据
- 伪造下载、转录或文档链接
!需要人工介入
- 确认非公开内容的处理授权
- 校对标记为 [待确认] 的术语
- 复核低音质或多人抢话录音
- 手动处理失败的飞书协作者权限
- 必要时先审核大纲再继续
TOOL STACK
一套清晰、可复现的工具链
每个工具只负责自己擅长的一段流程。
PUBLIC DEMO, PRIVATE AGENT
看起来像真实体验,
但权限与数据始终留在本地。
01没有后端网页只包含 HTML、CSS 和前端 JavaScript。
02没有真实输入访客只能选择预置案例,不能上传文件或提交链接。
03没有任何凭据不包含 Hermes、飞书、模型或其他服务的 API Key。