Saw an interesting video from @andreijikh about South Korea’s AI bubble having popped and couldn’t quite grasp some of the context even after rewatching a few times - In comes transcribe.so with the save, giving me a full transcript and letting me ask questions 🙌🔥
Intelligente Transkription für Audio und Video
BerufstätigeStudierendeCreator
Finde heraus, wer was gesagt hat und wann genau es gesagt wurde.
Transkribiere jedes Video, Meeting, jede Vorlesung oder jeden Podcast. Durchsuche das Gesagte, stelle Fragen und erhalte belegte Antworten. Springe direkt zur exakten Stelle.
Keine Kreditkarte erforderlich.
Sprecher-Labels·Zeitstempel pro Wort·52 Sprachen und Dialekte·Verarbeitung auf eigener Infrastruktur
Command Palette
Search for a command to run...
Echte Beiträge auf X
So finden Menschen heraus, wer was gesagt hat
Thanks @shsunmoon, I used @transcribeso twice for tricky Arabic YouTube videos, and the results were really good! It gave me full Arabic transcripts and kept them in my account for later retrieval so I could share them with ChatGPT instead of watching the full videos!
So I have been using handy and its really handy hahaha. it failed to transcribe a 10 min voice memo. That kinda sucked. I tried out transcribe.so and it did an amazing job. it can also handle hours of video&audio.
Was lange Aufnahmen wirklich kosten
Du weißt noch, wer es gesagt hat. Aber du findest die Stelle nicht wieder.
Ein Kunde stimmt einer Änderung des Projektumfangs zu. Eine Professorin erklärt endlich das Konzept. Ein Gast sagt genau den Satz, den du zitieren möchtest. Die Aufnahme weiß genau, wer was wann gesagt hat, verrät es dir aber nicht. Also suchst du auf der Zeitleiste, springst zu weit, spulst zurück und gibst dich schließlich mit „Ich glaube, es war irgendwo in der Mitte“ zufrieden.
Pro langer Aufnahme
3-stündige Aufnahme mit einer Stelle, die du wiederfinden musst
+ 20 bis 40 Min. Suche nach der Person und der Stelle
+ 30 bis 60 Min. erneutes Anhören bei 1,5-facher Geschwindigkeit
+ Eine Zusammenfassung ohne Namen und Zeitstempel
+ ∞ Min. Grübeln, in welcher Aufnahme es war
= Ein verlorener Abend.
Es geht auch schneller.
So funktioniert es
In drei Schritten von der Aufnahme zum brauchbaren Ergebnis
Echte Screenshots aus einem echten Transkript. Genau das bekommst du.
- 1
Füge beliebige Inhalte hinzu
Füge einen Link ein oder lade eine Datei hoch. Meetings, Vorlesungen, Podcasts, Videos und Sprachnotizen funktionieren alle auf dieselbe Weise.
Startklar in weniger als einer Minute

- 2
Erhalte ein strukturiertes Transkript
Jedes Transkript enthält Sprecher-Labels, Zeitstempel pro Wort, Zusammenfassungen und Kapitel, die wie von einem Menschen geschrieben klingen und nicht wie eine automatisch erstellte Gliederung.
Aus Stunden Audio werden wenige Minuten Lesezeit

- 3
Arbeite mit der Aufnahme
Durchsuche sie, stelle Fragen und erhalte belegte Antworten, springe zur exakten Stelle und exportiere bei Bedarf Notizen oder Untertitel.
Stefanie Stahl3:27Schreibstil und Lesbarkeit von SachbüchernUwe Jäger0:00Vorstellung der Psychologin Stefanie StahlJede Antwort nennt die Person und die genaue Stelle.
Keine Kreditkarte erforderlich.
Eine Nachricht vom Gründer
Hey, ich bin Seunghun 👋
2023 habe ich Spotify verlassen, um ein Startup aufzubauen, mit dem sich wichtige Momente in langen Inhalten finden lassen.
Die KI war damals noch nicht gut genug und das Unternehmen scheiterte.
2025 wurde mir klar, dass die Technologie endlich so weit war. Also kündigte ich meinen Job und entwickelte transcribe.so.
Ich habe aufschlussreichen Gesprächen schon immer gern zugehört. Aber um etwas wiederzufinden, musste ich stundenlange Inhalte erneut abspielen.
Ich musste eine bessere Möglichkeit schaffen, um herauszufinden, wer was wann gesagt hat.
Das bekommst du
Alles, was du brauchst, um eine Aufnahme zu verstehen
Du weißt, wer es gesagt hat
Sprecher-Labels trennen die einzelnen Stimmen, damit du siehst, wer was gesagt hat. So ist eine Zusage eindeutig einer bestimmten Person zugeordnet und nicht nur eine anonyme Zeile in einem dichten Textblock.
Du weißt genau, wann es gesagt wurde
Zeitstempel pro Wort verbinden jede Zeile mit der Aufnahme. Klicke auf einen Satz und die Wiedergabe springt genau zu der Sekunde, in der er gesagt wurde.
Fragen statt noch einmal ansehen
Stelle der Aufnahme eine Frage und erhalte eine Antwort mit Quellenangaben. Jede Quellenangabe führt zur entsprechenden Stelle, damit du sie selbst überprüfen kannst.
Suche und belegte Antworten
Frag die Aufnahme. Überprüfe die Antwort.
Eine Zusammenfassung sagt dir, worum es in einer Aufnahme ging. Mit einer Frage erfährst du, wer was genau wann gesagt hat. Jede Antwort öffnet die entsprechende Stelle.
Eine echte Frage zu einem echten Transkript
Wie entlarvt Stefanie Stahl Egozentrik und Narzissmus bereits im ersten Gespräch?
Der bereitgestellte Transkriptabschnitt enthält keine Informationen darüber, wie Stefanie Stahl Egozentrik oder Narzissmus spezifisch im ersten Gespräch entlarvt. Die Themen konzentrieren sich stattdessen auf allgemeine psychische Mechanismen, das Selbstwertgefühl und den Einfluss der Kindheit. Es wird erläutert, wie man eigene Gefühle und Trigger hinterfragt, um deren wahren Ursprung zu verstehen. Eine konkrete Methode zur Diagnose von Narzissmus in Erstgesprächen wird in diesen Ausschnitten nicht beschrieben.
- Die Antworten stammen aus der Aufnahme selbst, nicht aus allgemeinem Wissen
- Jede Antwort belegt, wer etwas gesagt hat und zu welchem genauen Zeitpunkt
- Klicke auf eine Quellenangabe und die Wiedergabe startet an genau dieser Sekunde
- Stelle Fragen zu einer Datei oder gleichzeitig zu deiner gesamten Bibliothek
Qualität und Sprachen
Ein Transkript, das du nutzen kannst, ohne es eine Stunde lang zu korrigieren.
Ein Transkript ist nur dann nützlich, wenn du ihm vertrauen kannst. Unsere Transkripte sind sofort bereit zum Lesen, Durchsuchen und Zitieren.
- Saubere Zeichensetzung, Groß- und Kleinschreibung sowie Absätze statt eines dichten Textblocks in Kleinbuchstaben
- Sprecher-Labels bei Aufnahmen mit mehreren Personen
- Verlässliche Zeitstempel pro Wort für Untertitel und Clips
- Auch außerhalb des Englischen hohe Genauigkeit, mit Fehlerraten-Bändern pro Sprache aus veröffentlichten Benchmarks
1,5- bis 2,3-mal weniger Fehler als Whisper large-v3 in veröffentlichten Vergleichen mit identischer Datenaufteilung.
Getestet für 52 Sprachen und Dialekte, darunter Kantonesisch, Mandarin, Japanisch, Koreanisch, Arabisch und Hindi.
Hör auf zu suchen. Fang an zu fragen.
Verarbeitung auf eigener Infrastruktur
Deine Aufnahmen bleiben privat.
Transkription, Sprechererkennung, Kapitel, Suche und Q&A laufen vollständig auf der von uns betriebenen Infrastruktur. Deine Inhalte werden nicht an externe KI-Anbieter gesendet und nur mit deiner Zustimmung zum Trainieren von KI-Modellen verwendet.
- Bei der Übertragung und Speicherung verschlüsselt
- Deine Inhalte werden niemals verkauft
- Lösche jederzeit einzelne Aufnahmen oder dein gesamtes Konto
- Nur mit deiner Zustimmung zum Trainieren von KI-Modellen verwendet
Eine Bibliothek, nicht nur ein einzelnes Transkript
Jede Aufnahme wird Teil deines Gedächtnisses.
Die meisten Tools geben dir ein einzelnes Transkript und vergessen es danach. Hier wird jedes Meeting, jede Vorlesung und jedes Video Teil einer Bibliothek, die durchsuchbar bleibt, solange du sie behältst.
Alle Transkripte durchsuchen
Finde in Sekundenschnelle ein Zitat, ein Thema oder die Aussage einer bestimmten Person zum Budget, selbst in stundenlangen Aufnahmen.
Fragen zu mehreren Aufnahmen stellen
Eine einzige Frage kann deine gesamte Bibliothek einbeziehen und enthält Quellenangaben zu jeder Aufnahme.
Die ursprüngliche Stelle wieder öffnen
Jedes Ergebnis führt zurück zur Wiedergabe, damit du genau hören kannst, wie etwas gesagt wurde.
Alles an einem Ort behalten
Kapitel, Notizen und Exporte bleiben mit der jeweiligen Aufnahme verbunden, statt sich auf verschiedene Tools zu verteilen.
Für Entwickler
Statte dein Produkt mit derselben Audio-Engine aus.
Hinter dieser Seite arbeitet eine API. Sende Medien und erhalte strukturierte Transkripte mit Sprechern und Zeitstempeln.
- Audio und Video mit einem einzigen HTTP-Aufruf transkribieren
- Integrierte Sprechererkennung und Ausgabe mit Zeitstempeln
- Ein MCP-Server für Agents und eine OpenAPI-Spezifikation für alles Weitere
- Ein Bearer-Token, während Guthaben und Verlauf mit der Web-App synchron bleiben
Preise
Transkribiere mehr, ohne ständig auf die Uhr zu schauen.
Starte mit $1 kostenlosem Guthaben. Wähle für gelegentliche Dateien die nutzungsbasierte Abrechnung für $1 pro Stunde oder für regelmäßige Nutzung einen unbegrenzten Tarif ab $9 pro Monat. Eine Standard-Engine verarbeitet jede Datei, du musst nichts auswählen.
Kostenlos
Kein Abonnement
- Standard-Transkription für $1 pro Stunde
- Alle KI-Funktionen: Zusammenfassungen, Kapitel, Sprecher-Labels und Suche
- KI-Q&A
- Dateien mit bis zu 90 Minuten Länge
- Guthaben verfällt nie
- API- und MCP-Zugriff in jedem Tarif
Pro
Unbegrenzt für anspruchsvolle Arbeit
- 3 Transkriptionen gleichzeitig
- Dateien mit bis zu 5 Stunden Länge
- Unbegrenztes KI-Q&A mit längeren Antworten
- E-Mail-Support
Business
Unbegrenzt und für Teams entwickelt
- Alles aus Pro
- 15 Transkriptionen gleichzeitig
- Dateien mit bis zu 10 Stunden Länge
- Bevorzugte Verarbeitung
Wähle die jährliche Abrechnung und erhalte 3 Monate kostenlos. Starter- und Enterprise-Tarife findest du auf der vollständigen Preisseite.
Jederzeit kündbar. 7 Tage Geld-zurück-Garantie für kostenpflichtige Tarife.
FAQ
Bevor du transcribe.so ausprobierst
Finde heraus, wer es gesagt hat. Springe zur exakten Stelle.
Füge dein erstes Meeting, deine erste Vorlesung, deinen ersten Podcast oder dein erstes Video hinzu und verwandle die Aufnahme in ein Transkript, das du durchsuchen, befragen und überprüfen kannst.
Keine Kreditkarte erforderlich.