Transcribe.soTranscribe.so

更智能的音视频转写

职场人士学生创作者

找出谁说了什么 以及说这句话的准确时间。

转写任何视频、会议、课程或播客。搜索对话内容,提问并获得带引用的回答,还能直接跳到准确时刻。

无需信用卡。

说话人标注·词级时间戳·52 种语言和方言·自有基础设施处理

AI對知識工作下戰帖?誰是失落的一代?簡立峰揭殘酷真相:1%的「超級人類」將掠奪99%的未來 Ft. Google台灣前董事總經理 簡立峰【哈佛商業評論✕人物面對面】S2Ep56
哈佛商業評論
试试这份真实转写文本
谁在何时说了什么
目录✍️Human written like chapters
9 chapters · 21 sections
1AI把及格线拉高到80分,你准备好了吗?
2为什么水电工比AI爱因斯坦更难被取代?
3美中AI军备竞赛:下一个核武器时刻
4初级工程师消失:资深者更强,新人更惨
5别做做题家:广度比深度更重要
向这个视频提问
🎯找出谁在何时说了什么
Answer
简立峰认为水电工难以被取代,是因为这类工作依赖“眼耳鼻舌身”的综合感官体验与隐性经验,无法仅透过书本知识学习 。相较于能处理语言和逻辑的AI,需要手眼协调及对物理环境敏捷反应的操作,目前仍是技术上的巨大挑战 。因此,他预测短期内会出现AI爱因斯坦,但二十年内都无法出现能胜任水电工作的AI机器人。

Command Palette

Search for a command to run...

X 上的真实帖子

用户用它找出谁说了什么

长录音的真实成本

你记得是谁说的,却怎么也找不回那一刻。

客户同意调整项目范围。教授终于讲清了那个概念。嘉宾说出了你想引用的那句话。录音明明知道是谁在何时说的,却不会直接告诉你。于是你来回拖动进度条、错过、倒回,最后只能说:“我记得大概在中间。”

每段长录音

3 小时录音,只为找回其中一个片段

+ 花 20 到 40 分钟拖动进度条,寻找是谁说的

+ 花 30 到 60 分钟以 1.5 倍速重听

+ 一份没有姓名、没有时间戳的摘要

+ ∞ 分钟回想它究竟在哪段录音里

= 一个晚上,就这样没了。

其实可以更快。

工作方式

三步把录音变成可用信息

真实转写文本的真实截图。这就是你会得到的结果。

  1. 1

    添加任何内容

    粘贴链接或上传文件。会议、课程、播客、视频和语音备忘录,处理方式都一样。

    不到一分钟即可开始

    粘贴 YouTube URL 或上传文件以开始转写
  2. 2

    获得结构化转写文本

    每份转写文本都包含说话人标注、词级时间戳、摘要和章节。读起来像人工整理,而不是自动生成的大纲。

    数小时音频,几分钟读完

    带时间戳的自动生成章节和主题摘要
  3. 3

    真正用好录音

    搜索内容、提问并获得带引用的回答、跳到准确时刻,还能按需导出笔记或字幕。

    通过行内时间戳和带引用的主题卡片回答问题

    每个回答都会标明说话人和对应时刻。

无需信用卡。

开发者的话

你好,我是 Seunghun 👋

2023 年,我离开 Spotify,创业解决长内容中重要片段难以查找的问题。

当时 AI 还不够成熟,创业失败了。

到了 2025 年,我意识到技术终于跟上了。于是我辞掉工作,做出了 transcribe.so。

我一直喜欢听有深度的对话。但想重新找到某段内容,就得重播数小时。

所以,我必须做出一种更好的方式,找出谁在何时说了什么

你会得到什么

理解一段录音所需的一切

知道是谁说的

说话人标注会区分每个声音,让你看清谁说了什么。一项承诺会明确归属于某个人,而不是埋在密密麻麻文字中的匿名句子。

知道准确时间

词级时间戳会把每句话与录音对应起来。点击任意句子,即可从说出这句话的准确秒数开始播放。

直接提问,不必重看

向录音提问,获得带引用的回答。每条引用都能跳到来源片段,方便你亲自核实。

搜索与带引用的回答

向录音提问,亲自核实回答。

摘要只能告诉你录音讲了什么。提问则能告诉你谁在何时说了什么,而且每个回答都能打开对应的原始片段。

真实转写文本中的真实问题

简立峰为何认为水电工比AI爱因斯坦更难被取代?

简立峰认为水电工难以被取代,是因为这类工作依赖“眼耳鼻舌身”的综合感官体验与隐性经验,无法仅透过书本知识学习。相较于能处理语言和逻辑的AI,需要手眼协调及对物理环境敏捷反应的操作,目前仍是技术上的巨大挑战。因此,他预测短期内会出现AI爱因斯坦,但二十年内都无法出现能胜任水电工作的AI机器人。

  • 回答来自录音本身,而不是通用知识
  • 每个回答都会附上引用,标明是谁说的以及说话的准确时刻
  • 点击引用,即可从对应的准确秒数开始播放
  • 可向单个文件或整个资料库提问

质量与语言

无需花一小时修改,就能直接使用的转写文本。

只有值得信赖的转写文本才真正有用。我们的结果拿到手即可阅读、搜索和引用。

  • 标点、大小写和分段清晰,不再是一大段密密麻麻的小写文字
  • 多人音频支持说话人标注
  • 可靠的词级时间戳,可用于字幕和剪辑
  • 非英语内容同样经得起检验,按语言提供来自公开基准测试结果的错误率区间
错误更少
已发布的同数据划分基准测试

在已发布且采用相同数据划分的对比中,Whisper large-v3 的错误数是我们的 1.5 至 2.3 倍。

52
支持的语言和方言

已对 52 种语言和方言 进行基准测试,包括粤语、普通话、日语、韩语、阿拉伯语和印地语。

查看完整基准测试 →

别再拖进度条,直接提问。

自有基础设施处理

你的录音始终私密。

转写、说话人识别、章节、搜索和问答均在我们运营的基础设施上完成。你的内容不会发送给第三方 AI 提供商,也绝不会用于训练 AI 模型,除非你主动选择同意。

  • 传输和存储全程加密
  • 绝不出售你的内容
  • 随时删除单条录音或整个账号
  • 除非你主动同意,否则不用于训练 AI 模型

阅读隐私政策 →

不只是一份转写文本,更是资料库

每段录音都会成为你的记忆。

大多数工具交付一份转写文本后就结束了。在这里,每场会议、每堂课和每个视频都会进入资料库。只要你保留它们,就能一直搜索。

搜索所有转写文本

几秒内从数小时录音中找到一句引用、一个主题,或某位说话人关于预算说过的话。

跨多段录音提问

一次提问就能综合整个资料库中的内容,并附上指向各个来源的引用。

重回原始片段

每条结果都链接到原始播放位置,让你听清当时究竟是怎么说的。

所有内容集中保存

章节、笔记和导出内容始终附在对应录音中,不会散落在不同工具里。

面向开发者

让你的产品也用上同一套听懂内容的引擎。

这个页面背后的引擎就是 API。发送媒体文件,即可获得带说话人标注和时间戳的结构化转写文本。

  • 一次 HTTP 调用即可转写音频和视频
  • 内置说话人识别和带时间戳的输出
  • 为智能体提供 MCP 服务器,其他场景则有 OpenAPI 规范
  • 只需一个 Bearer 令牌,余额和历史记录与网页应用保持同步

价格

放心多转写,不必盯着时长。

注册即获 $1 免费额度。偶尔处理文件,可选每小时 $1 的按量付费;经常使用,可选每月 $9 起的无限套餐。所有文件均由同一个标准引擎处理,无需选择。

免费版

无需订阅

$0
  • 标准转写,每小时 $1
  • 全部 AI 功能:摘要、章节、说话人标注和搜索
  • AI 问答
  • 单个文件最长 90 分钟
  • 余额永不过期
  • 所有套餐均可使用 API 和 MCP
热门

Pro

无限量,适合高强度工作

$19/月
  • 同时转写 3 个任务
  • 单个文件最长 5 小时
  • 无限量 AI 问答,回答更长
  • 电子邮件支持

Business

无限量,为团队打造

$49/月
  • 包含 Pro 的全部功能
  • 同时转写 15 个任务
  • 单个文件最长 10 小时
  • 优先处理

选择年付,免费获赠 3 个月。Starter 和 Enterprise 套餐请前往完整价格页面查看。

随时取消。付费套餐享 7 天退款保证。

常见问题

试用 transcribe.so 前,你可能想知道

找出是谁说的,直达准确时刻。

添加你的第一场会议、一堂课、一期播客或一个视频,把它变成可搜索、可提问、可核实的转写文本。

无需信用卡。