Zusammenfassung
RAVE ist ein Echtzeit-Audio-Variational Autoencoder, der von IRCAM entwickelt wurde und für schnelle und hochwertige neuronale Audiosynthese konzipiert ist. Es ist als Open-Source-Implementierung auf GitHub verfügbar.
Funktionen
- Variational Autoencoder-Modell, optimiert für Echtzeit-Audiosynthese
- Mehrere Konfigurationen verfügbar, einschließlich kontinuierlicher und diskreter Modelle, kausale Faltungen für geringe Latenz und verschiedene architektonische Optionen
- Unterstützt das Training mit benutzerdefinierten Datensätzen mit Werkzeugen zur Datenvorverarbeitung, die ein Lazy Loading von Roh-Audiodateien ermöglichen
- Augmentationstechniken zur verbesserten Generalisierung wie Stummschalten, Kompression und Gain-Anpassungen
- Export von Modellen für Echtzeit-Streaming mit zwischengespeicherten Faltungen
- Vorgefertigte Modelle werden bereitgestellt und laufende Modellaktualisierungen
- Integration mit Max/MSP und PureData über nn~ für Live-Audiobearbeitung und Stiltransfer
- Unterstützung für batchweise Offline-Audioerzeugung
- Open-Source mit GPU-Beschleunigungsunterstützung (torch- und torchaudio-Abhängigkeiten)
Anwendung und Community
RAVE kann in Forschung, Musikperformance und Installationskontexten verwendet werden. Nutzer werden ermutigt, sich an Diskussionen auf dem Discord-Server des Projekts und in den IRCAM-Foren zu beteiligen. Tutorials zur neuronalen Synthese in DAWs, Max 8 und zum Training benutzerdefinierter Modelle sind verfügbar.
Kommentare
Anmelden , um zu bewerten, zu kommentieren und zu merken.
Noch keine Kommentare für dieses Tool.