Ilustración editorial para Cómo evaluar si Lyria 3.5 sigue instrucciones musicales
Imagen generada con gpt-image-2.5-sunburst para InferamaSource ↗
01

Ce qu’une évaluation publiée peut nous apprendre

Évaluer un générateur de musique suppose de distinguer deux questions souvent confondues : le son est-il agréable ou convaincant ? Et le morceau respecte-t-il les consignes données ? Une réponse positive à la première ne démontre pas la seconde. Une production peut sembler soignée tout en omettant le pont demandé, en changeant d’instrument au milieu d’une section ou en ignorant une contrainte portant sur les paroles. À l’inverse, un morceau peut respecter plusieurs exigences sans être celui que les auditeurs préfèrent.

La fiche officielle de Lyria 3.5 constitue un point de départ pour comprendre les évaluations déclarées par le fournisseur. D’après sa description disponible, elle mentionne des évaluations humaines et automatiques, des tests en distribution et hors distribution, ainsi que des aspects liés au respect du prompt et aux limites du modèle. Ces informations aident à se demander ce qui a été mesuré, mais elles ne suffisent pas à elles seules à reconstituer une expérience : il faut consulter les détails à jour concernant les procédures, les consignes d’évaluation, la taille et la composition des échantillons ainsi que les conditions de génération.

L’annonce de Google sur Lyria 3.5 décrit également des améliorations revendiquées en matière de musicalité, de paroles, de voix, de respect des consignes et de contrôle du tempo et de la durée. Il s’agit d’affirmations du fournisseur au sujet du système ; elles ne constituent pas une mesure indépendante et ne permettent pas de déduire que chaque instruction précise est suivie selon un taux donné. Pour les interpréter, il faut savoir comment chaque capacité a été définie opérationnellement et si les résultats concernent le canal et la version que l’on souhaite utiliser.

La recommandation BS.1534 de l’UIT peut guider la conception d’évaluations subjectives de l’audio, mais elle n’a pas pour objectif de mesurer directement si un modèle a respecté un prompt musical. De même, des travaux comme MusicEval et MusicGen offrent des précédents utiles pour réfléchir aux évaluations humaines, à la qualité et à l’alignement. Ils ne constituent pas des preuves directes des performances de Lyria 3.5. Le protocole proposé dans cet article est une démarche méthodologique : il n’attribue pas à Lyria des résultats que les sources disponibles ne documentent pas.

02

Définir l’unité de test avant de générer

L’unité de base ne devrait pas être « un bon morceau » ni « un prompt » pris dans un sens vague. Il est préférable d’enregistrer une instruction, une génération obtenue dans des conditions précises et une liste explicite d’exigences évaluables. Si plusieurs générations sont produites à partir de la même instruction, chaque fichier audio constitue une observation distincte. L’ensemble permet d’étudier la variabilité, mais ne doit pas devenir une sélection des meilleurs exemples.

Pour que le suivi des instructions puisse être vérifié, il faut traduire les formulations générales en critères observables. « Donner une ambiance cinématographique » peut être conservé comme appréciation subjective, mais ne constitue pas un test binaire sans définition convenue. En revanche, « inclure un pont instrumental entre le deuxième refrain et la fin » permet d’évaluer la présence et l’emplacement de cette section, à condition que la structure soit identifiable dans l’audio. Si elle reste ambiguë, les évaluateurs doivent pouvoir répondre « indéterminable » plutôt que d’être contraints de trancher.

Chaque enregistrement doit préciser le nom et la version exacts du modèle, le canal d’accès, la date d’exécution, le texte du prompt et les paramètres disponibles. Si le canal permet de fixer ou de consigner des paramètres susceptibles de modifier la génération, il faut les conserver. La documentation de Google AI destinée aux développeurs identifie le modèle stable sous le nom `lyria-3.5` ; cet identifiant illustre le type d’information à consigner, mais ne garantit pas que tous les canaux proposent les mêmes contrôles.

Il faut également définir à l’avance ce qui constitue un respect partiel de la consigne. Si l’instruction demande qu’un instrument soit présent « pendant tout le morceau », sa présence très brève ne devrait pas être notée comme un respect intégral. Pour les exigences de structure, il est utile de distinguer la présence d’une section, l’ordre des sections et leur continuité. Sans ces distinctions, deux évaluateurs peuvent attribuer la même note globale pour des raisons entièrement différentes.

Fiche minimale d’un test

  1. 01Conserver le prompt littéral et le décomposer en exigences indépendantes.
  2. 02Consigner le modèle, le canal, la version affichée, la date et les paramètres disponibles.
  3. 03Conserver chaque génération, y compris celles qui ne respectent pas la consigne ou dont la qualité est faible.
  4. 04Attribuer un identifiant à chaque fichier audio et masquer à l’évaluateur la condition expérimentale.
  5. 05Noter le respect de chaque exigence, le degré de confiance du jugement et la raison des désaccords.
03

Concevoir des prompts simples, composés et contradictoires

Les tests simples permettent de déterminer si un attribut isolé peut être évalué de façon cohérente. On peut, par exemple, demander un morceau instrumental avec des percussions légères, ou une chanson avec une voix principale et une ambiance sereine. Ces prompts ne démontrent pas un contrôle général : ils ne testent qu’une condition précise. Pour éviter qu’un résultat favorable ne découle d’une interprétation trop large, l’instruction doit préciser ce qui est nécessaire sans ajouter d’adjectifs qui ne seront pas évalués.

Les prompts composés vérifient si plusieurs exigences peuvent être satisfaites simultanément. Une instruction pourrait demander une chanson avec un couplet, un refrain et un pont, une ligne de basse présente dans les trois sections, un tempo modéré et des paroles qui ne mentionnent aucune marque. Chaque élément est évalué séparément. On peut ainsi constater que le modèle respecte la structure, mais échoue à respecter la contrainte sur les paroles, au lieu de résumer le tout par une impression générale comme « plutôt fidèle ».

Les cas hors distribution doivent être définis de manière opérationnelle : instructions moins courantes, combinaisons inhabituelles ou formulations d’un attribut absentes du corpus principal. Il ne faut pas les qualifier de tests de « généralisation » sans préciser ce qui les distingue. Ils doivent être présentés à part et analysés comme un ensemble de mise à l’épreuve, plutôt que mélangés aux tests ordinaires pour faire monter ou baisser un chiffre sans contexte.

Les instructions contradictoires méritent aussi une catégorie à part. Demander simultanément une chanson « sans voix » et des paroles chantées crée, par exemple, des exigences incompatibles. Le résultat ne doit pas être noté comme s’il existait une seule réponse correcte. L’évaluation peut chercher à déterminer si le système repère le conflit, privilégie une consigne au détriment de l’autre ou produit une sortie ambiguë. Mais la règle de notation doit être annoncée avant l’écoute. Sans règle préalable, l’évaluateur risque d’adapter son critère après avoir découvert le résultat.

04

Séparer les dimensions dans les résultats

Un rapport utile distingue au moins quatre familles de résultats. La première concerne le suivi des instructions : chaque exigence est-elle présente, dans quelle mesure, et sur la base de quels éléments ? La deuxième porte sur la qualité musicale perçue, qui peut inclure des appréciations de cohérence, de composition ou d’agrément, à condition de les définir comme des jugements subjectifs et non comme des vérifications du prompt. La troisième concerne la qualité technique de l’audio, par exemple la présence de coupures ou de distorsion audibles. La quatrième, lorsque le morceau comporte des voix, est la qualité vocale : l’intelligibilité, la stabilité et l’adéquation perçue sont des questions différentes de celle de savoir si une voix a été incluse comme demandé.

Il est préférable de ne pas réduire ces familles à une seule note. Une moyenne agrégée peut masquer un cas important : un morceau obtient une appréciation élevée en matière d’agrément, mais ne respecte pas la moitié des exigences structurelles. Elle peut aussi cacher le fait que deux audios ayant le même résultat global échouent sur des attributs différents. Présenter les distributions et les résultats par exigence aide à mettre ces tendances en évidence sans laisser entendre qu’une dimension compense automatiquement une autre.

L’écoute à l’aveugle réduit certains biais : les personnes chargées de l’évaluation ne devraient pas savoir quel prompt a produit chaque audio, quelle génération l’équipe préfère ni quelle hypothèse est testée. L’ordre d’écoute doit varier, tandis que les consignes de notation restent identiques. Si les évaluateurs voient les paroles ou le prompt, l’évaluation n’est plus aveugle par rapport à ces informations. Lorsque celles-ci sont nécessaires à la notation, il faut indiquer précisément ce qui a été masqué et ce qui ne l’a pas été.

Une grille d’évaluation a besoin de repères concrets. Pour la présence d’un instrument, elle pourrait distinguer les catégories « absent », « perceptible brièvement seulement », « présent dans une partie du morceau » et « présent dans les sections indiquées ». Pour la structure, elle pourrait consigner chaque section et son ordre, ainsi qu’une option « indéterminable ». Ces repères constituent une proposition à tester auprès des évaluateurs ; ils ne forment pas une échelle universellement validée pour toutes les musiques.

Ce qu’il faut mesurer et ce qu’il ne faut pas en déduire

DimensionObservation possibleConclusion qui ne suffit pas à elle seule
Suivi des instructionsPrésence, absence, emplacement ou continuité de chaque exigenceLe fait que le morceau soit agréable
Qualité musicale perçueAppréciations humaines de la composition, de la cohérence ou de l’agrémentLe respect de toutes les exigences
Qualité technique de l’audioProblèmes audibles comme des coupures ou de la distorsionLe caractère musicalement convaincant du morceau
Paroles et voixRespect des contraintes sur les paroles, intelligibilité ou présence vocale demandéeLe respect du reste de la structure
05

Grille humaine et désaccords entre évaluateurs

Une écoute à l’aveugle ne garantit pas à elle seule la fiabilité de l’évaluation. Avant le test principal, il est utile de procéder à un calibrage avec des exemples d’entraînement et de vérifier si les définitions sont comprises de manière similaire. Cette étape permet de repérer les ambiguïtés — par exemple, ce qui constitue un « instrument continu » — et non d’éliminer les différences légitimes de goût musical. Les critères de respect des consignes doivent s’appuyer sur des éléments observables, et non sur le plaisir que l’évaluateur prend à écouter le morceau.

Chaque attribut doit être évalué indépendamment par plusieurs personnes, et les notes individuelles doivent être conservées. Le rapport doit présenter le niveau d’accord ou de désaccord par dimension, et non uniquement un chiffre général. Il peut indiquer les proportions de réponses concordantes et une mesure de concordance adaptée au type d’échelle, en expliquant comment celle-ci est définie. Si l’ensemble est de petite taille ou si certaines catégories sont très peu représentées, cette limite doit également être signalée plutôt que de présenter des estimations d’une précision apparente.

Les désaccords sont une information méthodologique. Si une partie des auditeurs repère le pont et une autre non, l’audio comporte peut-être une transition difficile à délimiter, ou la grille ne précise pas assez ce qui compte comme un pont. Si les évaluateurs ne s’entendent pas sur l’ambiance, cet attribut dépend peut-être de préférences ou de références culturelles que le protocole n’a pas définies. Il ne faut pas systématiquement régler chaque différence par un vote majoritaire puis la dissimuler. Une procédure d’arbitrage peut être utile, mais elle doit rester distincte des évaluations d’origine.

La recommandation BS.1534 de l’UIT porte sur l’évaluation subjective de la qualité audio dans des conditions contrôlées. Elle peut inciter à soigner la préparation et la présentation des stimuli, mais ne doit pas être citée comme une validation d’une grille mesurant l’obéissance musicale. Évaluer « est-ce que le son est bon ? » et « l’instrument est-il présent dans les sections indiquées ? » nécessite des questions, des repères et des analyses différents.

06

Automatisation : des vérifications ciblées, pas un substitut à l’écoute

L’analyse automatique peut être utile lorsque la question est étroite et que la méthode est suffisamment valide pour y répondre. On peut comparer la durée à une cible si l’on dispose d’un signal audio mesurable et d’une tolérance définie. La présence d’une voix ou la détection approximative de certains traits peuvent être explorées à l’aide d’outils adaptés, mais chaque outil peut produire des faux positifs et des faux négatifs. L’étiquette attribuée par un détecteur ne prouve pas, à elle seule, qu’une personne percevra le même attribut.

Le tempo, les instruments et la structure sont plus difficiles à transformer en vérifications universelles. Un estimateur peut proposer un nombre de battements par minute sans démontrer que la musique donne l’impression recherchée ; une détection de timbre n’établit pas nécessairement quel instrument un auditeur entend ; et les changements d’intensité ne permettent pas d’identifier automatiquement un couplet, un refrain ou un pont. Pour une évaluation technique rigoureuse, il faut décrire la méthode, son domaine de validité, son incertitude et les erreurs relevées par rapport aux annotations humaines.

Les contraintes portant sur les paroles ne peuvent être vérifiées par transcription et recherche que si les paroles sont reconnues avec une fidélité suffisante. L’absence d’un mot dans une transcription ne prouve pas qu’il est absent de l’audio. Si un outil signale une correspondance, il faut écouter le passage et en vérifier le contexte avant de conclure au respect ou à la violation de la consigne. En particulier, une recherche automatique sans erreur ne peut pas être présumée pour vérifier l’interdiction de citer des marques.

L’objectif n’est pas d’exclure l’automatisation, mais de l’utiliser comme élément de preuve complémentaire et de préciser ce qu’elle étaye. MusicEval étudie l’évaluation automatique de musique générée et son rapport avec les appréciations d’experts. Ce type de recherche peut inciter à la prudence, mais ne valide pas d’avance un outil destiné à mesurer Lyria 3.5. Si une métrique n’a pas été comparée à la tâche précise, elle doit être présentée comme un indicateur exploratoire, et non comme une preuve définitive.

Vérifier la validité d’une métrique automatique

  1. 01Définir l’attribut exact à mesurer et le champ d’application de l’outil.
  2. 02Comparer ses résultats à des annotations humaines indépendantes sur un échantillon pertinent.
  3. 03Consigner les faux positifs, les faux négatifs et les cas où l’outil ne peut pas trancher.
  4. 04Utiliser le résultat automatique comme un appui lorsqu’il est valide, et non comme un remplacement de l’écoute.
  5. 05Décrire l’incertitude et éviter de déduire la qualité musicale d’une détection technique.
07

Variabilité, cas difficiles et présentation des résultats

Une seule génération ne permet pas d’estimer la cohérence du modèle. Pour chaque prompt, l’équipe doit fixer à l’avance le nombre de générations à réaliser et appliquer le même plan à toutes les conditions. Il n’existe pas de nombre universel à recommander sans connaître le coût, la variabilité attendue et l’objectif de l’étude. Le choix doit être justifié et publié. Ne sélectionner que les résultats les plus réussis biaise l’évaluation en faveur d’une capacité de sélection plutôt que de la probabilité qu’une génération ordinaire respecte les consignes.

L’analyse doit rendre compte du respect de chaque exigence et de chaque prompt, ainsi que de la variation entre les générations. Pour la structure, par exemple, elle peut indiquer la proportion d’audios contenant les sections demandées et le nombre qui en respectent l’ordre prévu. Pour les instruments, elle peut distinguer leur présence au début de leur continuité au fil des parties indiquées. Les données manquantes ou indéterminables ne doivent pas être transformées silencieusement en réussites ou en échecs.

Il faut comparer avec prudence les résultats des prompts composés à ceux des prompts simples. Si une instruction longue échoue plus souvent, cela peut signaler une difficulté à combiner les exigences, mais aussi une plus grande ambiguïté du texte, une interaction entre les attributs ou une différence de difficulté au sein du jeu de test. L’interprétation doit s’appuyer sur les enregistrements et ne pas attribuer une cause que le protocole ne permet pas de distinguer.

Le rapport devrait inclure des exemples représentatifs de réussites, de non-respects et de désaccords, sans retenir uniquement les cas les plus frappants. Un morceau agréable qui omet le pont illustre pourquoi qualité et respect des consignes sont deux axes distincts. La détection automatique d’un instrument que les auditeurs ne parviennent pas à localiser montre pourquoi l’outil ne remplace pas l’écoute. Aucun de ces exemples ne suffit, à lui seul, à établir les performances générales du modèle.

Résultats qu’il est utile de publier

RésultatVentilation recommandéeLimite à expliciter
Respect des consignesPar exigence, par prompt et par type d’instructionDéfinition du respect partiel
CohérenceVariation entre plusieurs générations issues du même promptNombre de générations et règle de sélection
StructurePrésence, ordre et continuité des sectionsCas où la structure n’est pas identifiable
Évaluation humaineRésultats individuels et désaccords par attributFormation, mise à l’aveugle et arbitrage
AutomatisationMéthode utilisée et comparaison avec les annotations humainesAttributs non validés ou non mesurables
08

Reproductibilité et critères pratiques de décision

Un protocole est plus utile lorsqu’une autre personne peut reconstituer les conditions de l’expérience. Publier les prompts, les grilles d’évaluation, les consignes destinées aux évaluateurs, les règles d’inclusion et d’exclusion, la version du modèle et le canal utilisé permet de vérifier ce qui a été évalué. Si les conditions d’accès ou les modalités applicables empêchent de partager les fichiers audio, cette limite doit être expliquée et les éléments qui peuvent l’être doivent être fournis. Avant de diffuser des paroles, des voix ou d’autres contenus, il faut également vérifier que leur publication et leur réutilisation sont compatibles avec les droits et les conditions applicables ; il ne faut pas supposer que tout contenu généré peut être redistribué sans restriction.

L’identification exacte du modèle est importante, car une évaluation dépend de la version et du canal, pas seulement du nom commercial. Si le protocole est exécuté avec le modèle stable `lyria-3.5` par l’intermédiaire de l’API, ce canal et les contrôles disponibles doivent être consignés. Un résultat obtenu par une voie ne doit pas être présenté comme une garantie de comportement identique par une autre, en l’absence de données permettant cette comparaison.

Pour les équipes de production, la décision pratique ne devrait pas reposer sur une note générale. Il faut partir des exigences réellement importantes pour le flux de travail, examiner les attributs directement mesurés et vérifier l’ampleur de la variation d’une génération à l’autre. Si la continuité instrumentale est essentielle, une appréciation subjective élevée ne compense pas un non-respect répété de cette exigence. Si les paroles doivent respecter des contraintes strictes, une vérification spécifique est nécessaire ; une impression générale selon laquelle le morceau « a suivi le prompt » ne suffit pas.

La contribution principale d’un benchmark consacré au suivi des instructions n’est pas de proclamer qu’un modèle est bon ou mauvais, mais de rendre visibles ses conditions de réussite et ses modes d’échec. Pour Lyria 3.5, cela implique de décrire les instructions testées, de présenter séparément le respect des consignes et la qualité perçue, de conserver les générations et de traiter l’incertitude comme une partie du résultat. L’index des benchmarks peut fournir un contexte pour ce type d’évaluation, mais un test reproductible doit reposer sur son propre protocole, ses données et ses limites.

Questions ouvertes

  • Les informations des sources fournies ne précisent pas en détail tous les prompts, les tailles d’échantillon, les métriques ni les procédures des évaluations officielles de Lyria 3.5 ; ces éléments doivent être vérifiés dans la fiche à jour avant d’attribuer des résultats précis.
  • Il n’existe pas de nombre universel de générations ou d’évaluateurs adapté à toutes les études ; ce choix doit être justifié en fonction de l’objectif, du coût et de la variabilité observée.
  • La validité des outils automatiques de détection du tempo, des instruments, de la structure ou des contraintes sur les paroles dépend de l’outil et de la tâche ; elle doit être vérifiée par comparaison avec des annotations humaines.
  • Les conditions d’accès, les paramètres disponibles et les droits de publication peuvent varier selon le canal de génération et doivent être vérifiés pour chaque exécution.
09

Poursuivre l’exploration

09

Sources consultées

03

Corrections et transparence

Si vous repérez une information incorrecte ou obsolète, envoyez-nous la page et la source à vérifier.

Proposer une correction