Des chercheurs entraînent des modèles du monde musicaux auto-supervisés
De nouveaux articles explorent des représentations apprises pour la génération de musique symbolique et l’arrangement au piano.
Pourquoi c'est important
Ces travaux ouvrent la voie à des agents de co-création musicale capables de séparer contenu musical, structure et style à partir de signaux auto-supervisés ou multimodaux. Ils pourraient rendre les outils de musique symbolique plus contrôlables tout en préservant la direction humaine dans les flux de composition.
Points clés
- 1.Un encodeur Swin V2 de 2,55 millions de paramètres a appris des caractéristiques hiérarchiques de musique symbolique.
- 2.La supervision des accords a amélioré la récupération conjointe des accords et la détection de la tonalité dans les tests de sondage.
- 3.Un cadre fondé sur Q-Former conditionne les arrangements pour piano à partir de lead sheets et d’un audio de référence.
Deux articles publiés sur arXiv décrivent des approches de génération et d’arrangement musicaux qui s’appuient sur des représentations apprises plutôt que sur des étiquettes explicites de théorie musicale. Le premier présente un encodeur Swin V2 de 2,55 millions de paramètres entraîné sur des images de piano-roll MIDI avec des objectifs de type JEPA, et constate que les informations de phrase, de densité et d’harmonie émergent à différents niveaux de la hiérarchie ; la supervision des accords a amélioré la récupération conjointe des accords de 0,18 à 0,54 et la détection non supervisée de la tonalité de 0,16 à 0,70. Le second introduit un cadre multimodal qui extrait des représentations de style à partir d’un modèle de langage audio pré-entraîné au moyen d’un Q-Former, puis les utilise pour conditionner un modèle de langage symbolique destiné aux arrangements pour piano.
⚡ À tester aujourd'hui
Consultez les articles avant de développer des fonctions de génération musicale nécessitant une structure contrôlable, un transfert de style ou un arrangement pour piano.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGHelping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and GenerationAug 6, 12:00 PM↗
- arXiv cs.AILearning Music Style for Piano Arrangement Through Cross-Modal BootstrappingAug 5, 12:00 PM↗
- HF Daily PapersHelping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and GenerationAug 5, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.