Transcribe.soTranscribe.so

音訊與影片智慧轉錄

專業人士學生創作者

找出誰說了什麼 以及確切的時間。

轉錄任何影片、會議、課堂或 Podcast。搜尋談話內容、提問並取得附引用的回答,再直接跳到確切片段。

無需信用卡。

說話者標註·詞級時間戳·52 種語言和方言·自有基礎架構處理

AI對知識工作下戰帖?誰是失落的一代?簡立峰揭殘酷真相:1%的「超級人類」將掠奪99%的未來 Ft. Google台灣前董事總經理 簡立峰【哈佛商業評論✕人物面對面】S2Ep56
哈佛商業評論
試用這份真實逐字稿
誰在何時說了什麼
目錄✍️Human written like chapters
9 chapters · 21 sections
1AI把及格線拉高到80分,你準備好了嗎?
2為什麼水電工比AI愛因斯坦更難被取代?
3美中AI軍備競賽:下一個核武器時刻
4初級工程師消失:資深者更強,新人更慘
5別做做題家:廣度比深度更重要
向這支影片提問
🎯找出誰在何時說了什麼
Answer
簡立峰認為水電工難以被取代,是因為這類工作依賴“眼耳鼻舌身”的綜合感官體驗與隱性經驗,無法僅透過書本知識學習 。相較於能處理語言和邏輯的AI,需要手眼協調及對物理環境敏捷反應的操作,目前仍是技術上的巨大挑戰 。因此,他預測短期內會出現AI愛因斯坦,但二十年內都無法出現能勝任水電工作的AI機器人。

Command Palette

Search for a command to run...

X 上的真實貼文

大家用它找出誰說了什麼

長時間錄音的真正成本

你記得是誰說的,卻怎麼也找不回那個片段。

客戶同意變更專案範圍。教授終於把概念講清楚。來賓說出一句你想引用的話。錄音明明知道是誰在什麼時候說的,卻不會直接告訴你。於是你在時間軸上來回拖曳,一下跳過頭、一下又倒轉,最後只能說:「我記得大概在中間。」

每段長時間錄音

3 小時錄音,只為找回其中一個片段

+ 花 20 至 40 分鐘拖曳時間軸,尋找是誰說的

+ 花 30 至 60 分鐘以 1.5 倍速重聽

+ 一份沒有姓名與時間戳記的摘要

+ 無限分鐘懷疑內容到底在哪段錄音裡

= 一個晚上就這樣沒了。

其實有更快的方法。

運作方式

只要三個步驟,讓錄音真正派上用場

以下是真實逐字稿的實際畫面,也是你會得到的結果。

  1. 1

    加入任何內容

    貼上連結或上傳檔案。無論是會議、課堂、Podcast、影片或語音備忘錄,操作方式都一樣。

    開始所需時間:不到一分鐘

    貼上 YouTube 網址或上傳檔案以開始轉錄
  2. 2

    取得結構清楚的逐字稿

    每份逐字稿都包含說話者標註、詞級時間戳、摘要和章節,讀起來像真人整理,而不是自動產生的制式大綱。

    數小時音訊,化為幾分鐘即可讀完的內容

    自動產生附時間戳記的章節與主題摘要
  3. 3

    活用錄音內容

    搜尋內容、提問並取得附引用的回答、跳到確切片段,也能在需要時匯出筆記或字幕。

    以行內時間戳記和附引用主題卡回答問題

    每個回答都會標明說話者與對應片段。

無需信用卡。

開發者的話

嗨,我是 Seunghun 👋

2023 年,我離開 Spotify,投入創業,希望幫助大家從長篇內容中找出重要片段。

當時 AI 還不夠成熟,創業也以失敗告終。

到了 2025 年,我發現技術終於跟上了。於是我辭去工作,打造了 transcribe.so。

我一直很喜歡聆聽有深度的對談。但要再次找到某段內容,往往得重播好幾個小時。

所以,我必須打造一個更好的方法,找出誰在何時說了什麼

你會得到什麼

完整掌握一段錄音所需的一切

知道是誰說的

說話者標註會區分每個聲音,讓你清楚看到誰說了什麼。承諾會明確歸於特定的人,而不是淹沒在密密麻麻的匿名文字中。

知道確切時間

詞級時間戳會把每句話連回錄音。點一下句子,播放位置就會跳到說出這句話的確切秒數。

直接提問,不必重看

向錄音提問,即可取得附引用的回答。每則引用都能跳到原始片段,方便你親自核對。

搜尋與附引用的回答

向錄音提問,親自驗證回答。

摘要只能告訴你錄音大致談了什麼。提問則能讓你知道誰在何時說了什麼,而且每個回答都能從來源片段開始播放。

真實逐字稿中的真實問題

簡立峰為何認為水電工比AI愛因斯坦更難被取代?

簡立峰認為水電工難以被取代,是因為這類工作依賴“眼耳鼻舌身”的綜合感官體驗與隱性經驗,無法僅透過書本知識學習。相較於能處理語言和邏輯的AI,需要手眼協調及對物理環境敏捷反應的操作,目前仍是技術上的巨大挑戰。因此,他預測短期內會出現AI愛因斯坦,但二十年內都無法出現能勝任水電工作的AI機器人。

  • 回答來自錄音本身,而非一般知識
  • 每個回答都會引用說話者及其發言的確切片段
  • 點一下引用,就會從該發言的確切秒數開始播放
  • 一次針對單一檔案或整個內容庫提問

品質與語言

逐字稿拿來就能用,不必再花一小時校正。

逐字稿值得信賴,才能真正派上用場。我們提供的逐字稿拿到後就能直接閱讀、搜尋與引用。

  • 標點、大小寫與段落清楚,不再是一整片小寫文字
  • 多人音訊提供說話者標註
  • 可靠的詞級時間戳,可用於字幕與片段剪輯
  • 不只英文維持準確度,並依語言提供來自公開基準測試結果的錯誤率區間
錯誤更少
已發布的相同資料切分基準測試

在已發布、採用相同資料切分的比較中,錯誤比 Whisper large-v3 少 1.5 至 2.3 倍。

52
支援的語言和方言

基準測試涵蓋52 種語言和方言,包括粵語、華語、日語、韓語、阿拉伯語和印地語。

查看完整基準測試 →

別再拖曳時間軸,直接提問。

自有基礎架構處理

你的錄音會保持私密。

轉錄、說話者辨識、章節、搜尋與問答,全都在我們營運的基礎架構上執行。你的內容不會傳送給第三方 AI 供應商,也絕不會用於訓練 AI 模型,除非你主動選擇加入。

  • 傳輸中與靜態儲存時皆經過加密
  • 絕不販售你的內容
  • 隨時刪除個別錄音或整個帳號
  • 除非你主動選擇加入,否則不會用於訓練 AI 模型

閱讀隱私權政策 →

不只是一份逐字稿,而是一個內容庫

每段錄音都會成為你記憶的一部分。

多數工具交給你一份逐字稿後就結束了。在這裡,每場會議、每堂課和每支影片都會加入內容庫,只要你保留內容,就能持續搜尋。

搜尋所有逐字稿

只需幾秒,就能從數小時的錄音中找出一句引言、一個主題,或特定說話者對預算的看法。

跨多段錄音提問

一個問題就能查詢整個內容庫,並附上連回各個來源的引用。

回到原始片段

每筆結果都會連回播放位置,讓你聽見原話是怎麼說的。

所有內容集中整理

章節、筆記與匯出內容都會附在各自的錄音下,不再散落於不同工具。

開發者專用

讓你的產品也擁有同一套聆聽引擎。

這個頁面背後的引擎也以 API 提供。送出媒體,即可取得包含說話者與時間戳記的結構化逐字稿。

  • 一次 HTTP 呼叫即可轉錄音訊與影片
  • 內建說話者辨識與時間戳記輸出
  • 為代理程式提供 MCP 伺服器,其他用途則有 OpenAPI 規格
  • 只需一組 Bearer 權杖,額度與歷史記錄會和網頁應用程式同步

價格

自在轉錄更多內容,不必一直計算時間。

先取得 $1 免費額度。偶爾處理檔案可選擇每小時 $1 的按量計費,經常使用則可選擇每月 $9 起的不限量方案。所有檔案都由同一套標準引擎處理,不必費心挑選。

免費

無需訂閱

$0
  • 標準轉錄每小時 $1
  • 所有 AI 功能:摘要、章節、說話者標註、搜尋
  • AI 問答
  • 支援最長 90 分鐘的檔案
  • 錢包額度永不過期
  • 所有方案皆可使用 API 與 MCP
熱門

Pro

不限量,適合高強度工作

$19/月
  • 一次處理 3 項轉錄
  • 支援最長 5 小時的檔案
  • 不限量 AI 問答,提供更長的回答
  • 電子郵件支援

Business

不限量,專為團隊打造

$49/月
  • 包含 Pro 的所有功能
  • 一次處理 15 項轉錄
  • 支援最長 10 小時的檔案
  • 優先處理

選擇年繳可免費獲得 3 個月。Starter 與 Enterprise 方案請見完整價格頁面。

可隨時取消。付費方案提供 7 天退款保證。

常見問題

試用 transcribe.so 前,你可能想知道

找出是誰說的,直接跳到確切片段。

加入你的第一場會議、課堂、Podcast 或影片,將內容轉成可搜尋、可提問、可驗證的逐字稿。

無需信用卡。