Zum Hauptinhalt springen
tsecurity.de LIVE
Echtzeit-Radar & Feeds
Alle RSS Feeds
👥 Community & Social
Sichere ProgrammierungIntroducing mvnex v0.1.0: A Native CLI for Faster Maven Workflows(20.09.2026 um 01:54 Uhr)
Sichere ProgrammierungThe MCP server that changes its mind after you approve it(20.09.2026 um 02:01 Uhr)
Sichere ProgrammierungA code review benchmark that isn't the vendor ranking itself(20.09.2026 um 02:15 Uhr)
Linux Tipps & HardeningLinux Text Processing Quiz: Master grep, awk, sed & More(19.09.2026 um 17:02 Uhr)
Sichere ProgrammierungIntroducing mvnex v0.1.0: A Native CLI for Faster Maven Workflows(20.09.2026 um 01:54 Uhr)
Sichere ProgrammierungThe MCP server that changes its mind after you approve it(20.09.2026 um 02:01 Uhr)
Sichere ProgrammierungA code review benchmark that isn't the vendor ranking itself(20.09.2026 um 02:15 Uhr)
Linux Tipps & HardeningLinux Text Processing Quiz: Master grep, awk, sed & More(19.09.2026 um 17:02 Uhr)
Intelligence View
⚡ tsecurity.de Intelligence

Audio in Text umwandeln: Die besten KI-Tools im Vergleich

Die Umwandlung von Sprache in Text wird von immer mehr Menschen benötigt.

Während früher nur Büro-Assistenten und -Assistentinnen Diktate des Vorgesetzten abtippen mussten oder Journalisten die Aufzeichnung eines Interviews, wird heute mehr denn je gesprochen und anschließend verschriftlicht, etwa in Meetings und Videokonferenzen.

Entsprechend entwickeln sich Transkriptionstools zu wertvollen Helfern. Denn die Beschäftigten können damit viel Zeit sparen und effizienter arbeiten.

Sie laden ihre Audioaufnahmen im WAV- oder MP3-Format in die Software, das Programm erkennt die gesprochenen Beiträge und wandelt sie in Texte um, die sich in einem gängigen Textformat speichern lassen.

Einige Programme nehmen auch Videodateien entgegen und transkribieren deren Tonspur.

Der Stand der Dinge

Die Software ist in den vergangenen Jahren immer besser geworden, was auch, aber nicht nur auf den Einsatz von KI zurückzuführen ist. Die Zuordnung der Beiträge zu den verschiedenen Sprechern und das Einfügen von Zeitstempeln sind mittlerweile Standard.

Erheblich verbessert haben sich jedoch die Erkennungsraten. Gute Vertreter dieser Softwaregattung erfassen den Sinn des Gesprochenen, passen die Wörter grammatikalisch entsprechend an und achten auf eine korrekte Interpunktion.

Außerdem können sie auch qualitativ schlechte und verrauschte Aufnahmen wie Telefonmitschnitte mit zahlreichen Nebengeräuschen verarbeiten und daraus komplett korrekte Texte erstellen.

Datenschutz beachten: Alles in der Cloud

Die heute verbreiteten Transkriptionsprogramme erledigen ihre Arbeit nahezu ausnahmslos in der Cloud. Der Benutzer lädt die Audiodateien über eine lokal installierte Software oder eine Website ins Internet hoch, wo sie dann mit der Rechenpower eines Cloudservers bearbeitet werden.

Das ist bequem und geht schnell. Benutzer müssen dabei jedoch berücksichtigen, dass die Daten auf diese Weise eventuell bei US-Clouddiensten landen, was Fragen und Unsicherheiten zur datenschutzkonformen Nutzung der Daten aufwirft.

Mittlerweile existiert eine ganze Reihe von Webdiensten zur Transkription von Audioaufnahmen. Komplett kostenlos sind die wenigsten davon. Nahezu alle bieten jedoch eine kostenlose Testphase, in der sich zumindest kürzere Aufnahmen bearbeiten lassen.

Für diesen Artikel haben wir die Dienste ein kürzlich per Smartphone geführtes Interview transkribieren lassen.

Microsoft Word: Enttäuschende Ergebnisse

Abonnenten von Microsoft 365 haben in Word Zugriff auf einen Transkriptionsdienst. Sie finden ihn im Ribbon „Start“ im Bereich „Sprache“ unter „Diktieren –› Transkribieren“.

Word lädt die Audio- oder Videodatei zum Onedrive-Speicher des Benutzers hoch und bearbeitet sie dort. Das kann einige Minuten dauern.

Das Ergebnis erscheint in einer Randspalte. Man kann einstellen, dass Word bei jedem Beitrag den Sprecher und die Uhrzeit anzeigen soll. Die einzelnen Textabschnitte lassen sich in der Randspalte direkt bearbeiten und dem aktuell geöffneten Dokument hinzufügen.

Foundry

Der transkribierte Text wird zusammen mit dem Word-Dokument gespeichert, von dem aus die Funktion aufgerufen wurde. Sobald man die DOCX-Datei erneut öffnet und auf „Diktieren –› Transkribieren“ geht, ist auch die Randspalte mit dem Text wieder da.

Um die Transkription in einer eigenen Datei zu speichern, führt man die Transkription mit einem leeren Dokument aus und klickt zum Schluss auf den Button „Zu Dokument hinzufügen“.

Die Qualität der Transkriptionen von Word ist eher schlecht. Sie strotzen nur so vor Interpunktions- und Grammatikfehlern.

Die Redebeiträge und sogar die einzelnen Sätze eines Sprechers werden in mehrere Teile aufgespalten, Fachbegriffe werden nicht verstanden. So machte das Programm aus „Passkey“ regelmäßig „Parskey“. Die Nachbearbeitung der Texte ist entsprechend zeitaufwendig.

Foundry

Whisper AI: Transkribieren mit KI von Open AI

Die Firma Open AI, der Entwickler von ChatGPT, hat mit Whisper AI die Transkription von Sprachaufnahmen auf eine KI-Basis gestellt.

Laut Hersteller wurde die Software in 680.000 Stunden mit transkribierten Texten in verschiedenen Sprachen trainiert, die meisten darunter waren auf Englisch. Whisper soll daher auch in Audioaufnahmen in sehr schlechter Qualität noch Teile des Gesprochenen verstehen können.

Open AI stellt Whisper AI unter einer Open- Source-Lizenz frei zur Verfügung. Die Software ist auf Git Hub erhältlich. Allerdings handelt es sich bei dieser Urversion um ein wenig benutzerfreundliches Kommandozeilentool.

Mehrere Firmen bieten jedoch Transkriptionen mit Whisper über Webdienste oder lokal installierbare Programme mit einer grafischen Oberfläche an.

Foundry

Das Tool Vibe läuft lokal, ist kostenlos, funktionierte auf unseren Testrechnern aber nicht, weshalb wir es nicht in den Test aufnehmen konnten. Zu den Webdiensten mit Whisper gehören unter anderem Turboscribe und Cabina.ai.

Wir haben uns das Angebot der niederländischen Firma Whisper Transcribe angesehen. Nach einer kostenlosen Testphase von 60 Minuten kostet die Nutzung in der einfachsten Version rund 20 Dollar im Monat bei jährlicher Zahlung.

Wer den Windows-Client herunterlädt und installiert, kann alternativ dazu für 8 Dollar pro Stunde einen Pay-as-you-go-Plan wählen.

Foundry

Der lokal installierte Client von Whisper Transcribe kann nicht nur Audiodateien in Texte verwandeln. Er bereitet diese Texte zusätzlich für unterschiedliche Zwecke auf. So legt die Software automatisch eine Zusammenfassung an und bietet an, das Gespräch in mehrere Kapitel zu gliedern.

Sie erzeugt aus dem Gesagten Beiträge für Linkedin und X und schlägt bei Interviews zu den einzelnen Themen weiterführende Fragen vor.

Außerdem kann der Benutzer gezielt Fragen zum Inhalt des Transkripts stellen.

Die Textqualität ist deutlich besser als bei Word, auch Firmennamen und Fachbegriffe werden größtenteils korrekt erkannt. Die Grammatik stimmt im Großen und Ganzen, nur einige Sätze wurden im Test nicht als Fragen erkannt.

Für den Export stehen die Dateiformate DOCX, PDF und TXT bereit. Obwohl die Software eine englischsprachige Bedienoberfläche besitzt, transkribierte sie im Test auch deutschsprachige Beiträge ohne Umstellungsschwierigkeiten.

F4 – Traditionssoftware aus Deutschland

Die Software F4 von der Dr. Dresing & Pehl GmbH in Marburg existiert bereits mehrere Jahrzehnte.

Anfangs handelte es sich um ein Hilfsmittel für manuelle Transkriptionen, bei denen der Benutzer den gesprochenen Text abtippt. Später entwickelte die Firma f4x für die automatische Transkription sowie ein Tool für die qualitative Textanalyse.

Seit einigen Monaten werden alle drei Programme unter der Bezeichnung F4 zusammen vertrieben.

F4 ist kostenpflichtig, kostenlos ausprobieren kann man die Software lediglich 15 Minuten lang.

Die günstigste Variante der automatischen Transkription kostet 25 Euro für zwei Stunden. Der Hersteller bietet ein Gesamtpaket als Download für die lokale Installation an. In dieser Variante muss man die Software für mindestens 149 Euro lizenzieren und zusätzlich Kontingente für die automatische Transkription kaufen.

Daneben gibt es die Möglichkeit, die Audiodatei über die Website hochzuladen. In diesem Fall stehen jedoch keine Korrekturfunktionen zur Verfügung. Die Transkription wird ausschließlich auf Servern in Deutschland und gemäß den Regeln der DSGVO durchgeführt.

Foundry

Mit rund sechs Minuten benötigte F4 am längsten für die Spracherkennung unserer rund 40 Minuten langen Testaufnahme, Word und Whisper erledigten diese Aufgabe in zwei bis drei Minuten.

Anschließend kann man den transkribierten Text als DOCX-, RTF- oder im Untertitelformat SRT herunterladen. Das Ergebnis erreichte nicht die Qualität der Transkription von Whisper. Zwar wies F4 die Wortbeiträge korrekt den am Gespräch beteiligten Personen zu. Mit Fachbegriffen hatte die Software allerdings Schwierigkeiten.

Ein „Passkey“ wurde bei ihr zu einem „Paar Ski“, den Plural „Passkeys“ übersetzte sie mit „Partys“ oder „Tarskis“. KI-gestützte Zusatzfunktionen wie bei Whisper Transcribe sucht man vergebens.

Hinzu kam, dass die Software im Test im gesamten Text Wörter doppelt, drei- oder vierfach hintereinander setzte, so, als ob die Sprecher sie immer mehrfach gesagt hätten.

Eleven Labs: Günstig und gut

Eleven Labs ist für seine realistisch klingenden KI-Stimmen bekannt. Über die Website des Dienstes lassen sich unter anderem Filme und Videos lokalisieren, Musik erzeugen, Stimmen klonen oder auch Texte vorlesen.

Vor einigen Monaten ist nun auch eine Funktion für die Spracherkennung hinzugekommen. Und bereits heute gehört sie zu den qualitativ besten Angeboten auf dem Markt.

Foundry

Die Funktion ist als reiner Webdienst ausgeführt, ein lokal installierbarer Client ist nicht erhältlich. Eine Registrierung ist nicht erforderlich.

Der Benutzer klickt auf den Button „Speech to Text“, gibt an, ob er einen Conference Call, ein Interview oder ein Arztgespräch in Text übersetzen will, und lädt die Audiodatei hoch.

Nach wenigen Minuten wird der Text angezeigt, der sich anschließend als DOCX-, PDF-, TXT-, HTML-, SRT- oder JSON-Datei herunterladen lässt. Eleven Labs gibt an, dass in der kostenlosen Version bis zu 150 Minuten Sprachaufnahmen pro Monat verarbeitet werden können.

Obwohl Eleven Labs eine englischsprachige Oberfläche aufweist, kommt die Software auch gut mit deutschsprachigen Aufnahmen zurecht.

Die Qualität der Transkription von Eleven Labs war die beste, die wir in unserem kleinen Test gefunden haben. Sämtliche Fachbegriffe wurden richtig erkannt, Grammatik und Interpunktion stimmten, die Redebeiträge wurden richtig zugeordnet und zusammengefasst.

Allerdings verzichtet Eleven Labs auf jegliche Zusatzfunktionen, eine Weiterverarbeitung der Transkriptionen bietet dieser Onlinedienst also nicht an.

Transkriptionsjobs für Anfänger

Obwohl Transkriptionssoftware immer besser wird, gibt es nach wie vor Firmen, Organisationen und Behörden, die menschliche Transkriptoren bevorzugen.

Diese Nachfrage befriedigen Dienstleister, die oft mehrere Dutzend freie Mitarbeiter für das Abtippen von Sprachaufnahmen beschäftigen. Voraussetzung sind gute Deutschkenntnisse, ein gutes Hörvermögen und natürlich ein Computer mit Internetzugang.

Ob jemand diese Voraussetzungen erfüllt, wird in der Regel mit einem Test überprüft. Wer den besteht, bekommt anschließend mehr oder weniger regelmäßig Audioaufnahmen zum Transkribieren zugeschickt.

Reich werden kann man mit diesen Jobs natürlich nicht, die Bezahlung liegt durchschnittlich bei etwa einem Euro pro Audiominute. Als Nebenjob während des Studiums oder als Zweitjob sind diese Arbeiten jedoch geeignet.

Foundry

Anbieter sind im deutschsprachigen Raum unter anderem die Firmen Gotranscript, Mentorium und HappyScribe.

Ähnliche Beiträge
🔍 Verwandte News

Auch interessante Nachrichten Audio in Text umwandeln: Die besten KI-Tools im Vergleich

Thematisch verwandte Begriffe: Audio, Text, umwandeln, besten · 6 Treffer

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Zum Aktualisieren ziehen
ZERO-DAY CVE-2026-93987 | rclone versions 1.56.0 through 1.75.0 contain a path traversal vulnerabi…
Advisory →
TTS Reader • tsecurity.de Voice
tsecurity.de Icon
tsecurity.de App
Offline-Lesen, Eilmeldungen & 0ms Ladezeit

Installiere tsecurity.de direkt auf deinen Home-Bildschirm für das ultimative Vollbild-Magazinerlebnis ohne Browser-Leisten.

Nächster Beitrag
Themen-Radar & Intelligence Matrix
Echtzeit-Taxonomie nach Angriffsvektoren & Plattformen
Community Radar & Live Chat
Sentinel Bot online • Live-Stream
Dein Cluster: Security Explorer
Match:
lädt…
Verbindung zum Community-Stream wird aufgebaut...
Bearbeitungsmodus — Senden überschreibt deine Nachricht
Community-Puls — was gerade passiert
lädt…
Aktivitäten deiner Analysten
lädt…
Neues Thema oder Eilmeldung einreichen

Reiche interessante Links, Zero-Days oder Debatten ein. Die Community entscheidet per Upvote über die Veröffentlichung.

Heiß diskutierte Einreichungen
🔖 Gespeicherte Artikel
📂 Keine gespeicherten Artikel vorhanden.
Zurück Ziehen Vor
Links: vorheriger Artikel Rechts: nächster Artikel unten: schließen
News NIS-2 Frühwarnung Tier-1 Intel ⏱️ 3 Min vor 10 Min
Artikeldaten werden geladen...

Zurück: vorheriger Vor: nächster
↗ Original-Quelle
Social Reaktionen Deine Reaktion zählt
Einstufung & Relevanz-Poll 0 Stimmen
In sozialen Netzwerken teilen 1-Klick