Zusammenfassung
AudioSep ist ein Open-Domain-Sound-Trennungs-Grundlagenmodell, das die Trennung von Audiosignalen auf Basis von natürlichsprachigen Anfragen durchführt. Es kann verschiedene Schallquellen wie Audioereignisse, Musikinstrumente und Sprachverbesserung ohne aufgabenspezifisches Training trennen.
Funktionen
- Starke Zero-Shot-Verallgemeinerungsfähigkeit bei mehreren Aufgaben der Schallquellentrennung.
- Kann Klänge anhand natürlicher Sprachbeschreibungen trennen, was eine flexible und benutzerdefinierte Trennung ermöglicht.
- Unterstützt die Durchführung von Inferenz mit schnittbasierter Verarbeitung zur Speicherersparnis.
- Open-Source-Implementierung mit Trainingsskripten und Tools zur Benchmark-Auswertung verfügbar.
- Verarbeitet Audio mit 32 kHz Abtastrate unter Verwendung von STFT mit spezifizierten Fenster- und Hop-Größen.
Anwendung
Das Modell kann durch Klonen des Repositories und Installation der Abhängigkeiten mit conda eingerichtet werden. Modellgewichte sind zum Download verfügbar. Die Inferenz kann durch Bereitstellen einer Audiodatei und einer textuellen Beschreibung der zu trennenden Klangquelle durchgeführt werden.
Training ist mit benutzerdefinierten Audio-Text-Paar-Datensätzen möglich, die in einer bereitgestellten JSON-Struktur formatiert sind. Nutzer können das Modell von Grund auf trainieren oder von vortrainierten Checkpoints feinjustieren.
Evaluation
Benchmark-Auswertungsskripte und Datensätze werden bereitgestellt, um die Trennqualität auf diversen Audiodatensätzen zu messen, mit berichteten Ergebnissen wie SDR-Verbesserungen auf VGGSound, MUSIC, ESC-50, AudioSet, AudioCaps und Clotho.
Zitation
Das Repository bietet Referenzen für die akademische Zitation, falls das Werkzeug verwendet wird.
Kommentare
Anmelden , um zu bewerten, zu kommentieren und zu merken.
Noch keine Kommentare für dieses Tool.