Zusammenfassung
Demucs ist ein hochmodernes Musikquellentrennungsmodell, entwickelt von Meta AI, das in der Lage ist, Schlagzeug, Bass, Gesang und andere Spuren aus Songs zu trennen. Die neueste Version (v4) verfügt über eine Hybrid-Transformer-Architektur, die Spektrogramm- und Wellenform-Domänen kombiniert und eine wettbewerbsfähige Trennleistung erreicht.
Funktionen
- Hybrid-Transformer-Architektur mit domänenübergreifender Selbstaufmerksamkeit und Kreuzaufmerksamkeitsschichten.
- Trennt mehrere Quellen, darunter Schlagzeug, Bass, Gesang, Gitarre und Klavier (experimentell).
- Basierend auf einer U-Net-Convolutional-Architektur, inspiriert von Wave-U-Net.
- Erreicht hohe Signal-zu-Verzerrungs-Verhältnisse (SDR) im MUSDB HQ Testset.
- Unterstützt Modelle mit und ohne Fine-Tuning; sparse Attention-Kerne für erweiterte Empfangsfelder sind in Entwicklung.
- Trainiert auf dem MUSDB HQ Datensatz plus einem zusätzlichen Trainingsdatensatz mit 800 Songs.
- Bietet Kommandozeilenoptionen zur Aktivierung verschiedener Modellversionen.
- Open-Source mit Quellcode und Modellen auf GitHub verfügbar.
Zusätzliche Informationen
Das Projekt wird von Meta nicht mehr aktiv gepflegt; ein Fork eines Community-Mitglieds existiert für fortlaufende Fehlerbehebungen. Ein experimentelles 6-Quellen-Modell umfasst die Extraktion von Gitarre und Klavier, wobei die Klavierergebnisse derzeit Artefakte aufweisen. Detaillierte Metriken und Vergleiche mit anderen Quelle-Trennungsmodellen sind in den im Repository verlinkten Veröffentlichungen zu finden.
Kommentare
Anmelden , um zu bewerten, zu kommentieren und zu merken.
Noch keine Kommentare für dieses Tool.