Anmelden

Demucs (Meta AI)

Open Source
Plattform
Linux macOS Plattformagnostik Windows
Lieferform
Bibliothek/API Kommandozeile

Music Source Separation — Metas quelloffenes Deep-Learning-Modell für 4-Spur-Stem-Trennung auf dem Stand der Technik.

Zusammenfassung

Demucs ist ein hochmodernes Musikquellentrennungsmodell, entwickelt von Meta AI, das in der Lage ist, Schlagzeug, Bass, Gesang und andere Spuren aus Songs zu trennen. Die neueste Version (v4) verfügt über eine Hybrid-Transformer-Architektur, die Spektrogramm- und Wellenform-Domänen kombiniert und eine wettbewerbsfähige Trennleistung erreicht.

Funktionen

  • Hybrid-Transformer-Architektur mit domänenübergreifender Selbstaufmerksamkeit und Kreuzaufmerksamkeitsschichten.
  • Trennt mehrere Quellen, darunter Schlagzeug, Bass, Gesang, Gitarre und Klavier (experimentell).
  • Basierend auf einer U-Net-Convolutional-Architektur, inspiriert von Wave-U-Net.
  • Erreicht hohe Signal-zu-Verzerrungs-Verhältnisse (SDR) im MUSDB HQ Testset.
  • Unterstützt Modelle mit und ohne Fine-Tuning; sparse Attention-Kerne für erweiterte Empfangsfelder sind in Entwicklung.
  • Trainiert auf dem MUSDB HQ Datensatz plus einem zusätzlichen Trainingsdatensatz mit 800 Songs.
  • Bietet Kommandozeilenoptionen zur Aktivierung verschiedener Modellversionen.
  • Open-Source mit Quellcode und Modellen auf GitHub verfügbar.

Zusätzliche Informationen

Das Projekt wird von Meta nicht mehr aktiv gepflegt; ein Fork eines Community-Mitglieds existiert für fortlaufende Fehlerbehebungen. Ein experimentelles 6-Quellen-Modell umfasst die Extraktion von Gitarre und Klavier, wobei die Klavierergebnisse derzeit Artefakte aufweisen. Detaillierte Metriken und Vergleiche mit anderen Quelle-Trennungsmodellen sind in den im Repository verlinkten Veröffentlichungen zu finden.

Kommentare

Anmelden , um zu bewerten, zu kommentieren und zu merken.

Noch keine Kommentare für dieses Tool.