Anmelden

Speech to Text

Abo
Lieferform
Bibliothek/API Desktop App Kommandozeile Plugin

Hohe Genauigkeit bei der Transkription von Sprache zu Text inklusive Sprecherzuordnung und Zeitmarkierungen.

Zusammenfassung

Speech to Text von ElevenLabs bietet hochpräzise automatische Spracherkennungsmodelle, darunter Scribe v2 und Scribe v2 Realtime, die die Transkription von Live- und aufgezeichnetem Audio in über 90 Sprachen ermöglichen. Der Dienst bietet branchenführende Genauigkeit bei geringer Latenz und unterstützt diverse Akzente sowie Aufnahmebedingungen.

Funktionen

  • Scribe v2 Realtime: Echtzeittranskription mit einer Latenz von unter 150 ms, ideal für Live-Gespräche, Meetings und KI-Anwendungen in über 90 Sprachen.
  • Scribe v2: Wandelt Sprache aus Audio- und Videodateien in editierbaren Text, Untertitel und Captions mit hoher Genauigkeit um.
  • Erweiterte Funktionen: Sprachaktivitätserkennung, Sprecher- und Entitätenerkennung, dynamische Audiokennzeichnung, Schlüsselwort-Aufforderung und Schwärzung sensibler Informationen.
  • Mehrsprachige Unterstützung: Unterstützung von über 90 Sprachen mit unterschiedlichen Genauigkeitsstufen, von exzellent bis moderater Wortfehlerrate (WER).
  • API- und SDK-Zugang: Integration der Speech-to-Text-Funktionalitäten in Produkte über vollständig streamingfähige APIs und SDKs.
  • Sicherheit und Compliance: Datenschutz auf Unternehmensniveau mit Verschlüsselung und Unterstützung von SOC 2, HIPAA, GDPR, EU-Datenresidenz sowie Zero-Retention-Modi.
  • Flexible Bereitstellung: Cloud- und On-Premise-Optionen mit granularem Team-Berechtigungssystem und Unterstützung für benutzerdefinierte Workflows.
  • Preise: Mehrere Abonnementstufen von kostenlos bis Pro mit monatlicher Abrechnung, Preis pro transkribierter Stunde und Enterprise-Plänen.

Anwendungsfälle

Geeignet für die Transkription von Podcasts, Videos, Interviews, Meetings, Callcentern, KI-Agenteninteraktionen, Untertitelung für soziale Medien, Barrierefreiheitstools und alle Szenarien, die die Transkription von Live- oder aufgezeichneter Sprache erfordern.

Zusätzliche Informationen

Die Technologie basiert auf tiefen neuronalen Netzen, die mit großen mehrsprachigen Datensätzen trainiert wurden und eine Genauigkeit liefern, die andere Speech-to-Text-Lösungen wie Whisper und Deepgram in Benchmarks übertrifft.

Funktionen wie Sprecherdiarisierung ermöglichen die automatische Unterscheidung mehrerer Sprecher, und Echtzeittranskription ist über eine dedizierte Streaming-Architektur verfügbar.

Der Dienst beinhaltet Werkzeuge zur Bearbeitung und Verwaltung von Transkripten, Untertiteln und Captions und erleichtert so die Wiederverwertung von Inhalten sowie die Einhaltung von Barrierefreiheitsanforderungen.

Kommentare

Anmelden , um zu bewerten, zu kommentieren und zu merken.

Noch keine Kommentare für dieses Tool.