01 Contexte
Cold War 2 était un jeu en accès anticipé au moment du stage, développé par le studio indépendant Maestro Cinetik. Il s'agit d'un jeu de grande stratégie, à échelle mondiale et avec des actions économiques, diplomatiques, d'espionnage et de subversion, mais également de choix historiques et politiques. Contrairement aux wargames, la philosophie de Cold War 2 est plutôt d'éviter les conflits ouverts, susceptibles de déclencher l'apocalypse nucléaire.
Le studio est une très petite structure : le dirigeant est aussi le principal développeur et concepteur des jeux. Ce dernier jeu, crucial pour la pérennité du studio, concentre comme beaucoup de titres du genre une grande quantité d'informations à l'écran mais aussi des défauts d'interface liés au manque de moyens ou de connaissances en ergonomie et UX du développeur. Le but était donc de réduire la friction liée à l'interface et la surcharge sans enlever de profondeur au gameplay.
Mon rôle a été celui d'un UX Researcher junior autonome, sous la supervision du directeur du studio. J'ai pris en charge l'ensemble de la chaîne de recherche : cadrage, recrutement, passation, analyse et restitution des recommandations.
02 Problématiques
Un jeu de stratégie est souvent complexe à appréhender : la notion de charge cognitive est au cœur de ce type de jeu, et il est difficile pour le créateur du jeu de se rendre compte de la difficulté de l'apprentissage de sa création : cela fait partie du biais cognitif de la « malédiction de la connaissance ». Néanmoins différentes solutions sont possibles pour la rendre gérable par le joueur, en particulier lors de l'apprentissage du jeu (appelé onboarding). Hodent (2020) fait différentes recommandations pour un tutoriel efficace, notamment via l'usage d'un apprentissage distribué dans le temps et nécessitant un traitement actif du joueur (apprendre en faisant). Néanmoins, un tutoriel textuel ayant été réalisé récemment, et la création d'un tutoriel dynamique étant coûteuse, revoir l'UX du tutoriel n'a pas fait partie de mon périmètre de recherche.
Pour autant, pour apprendre à jouer un jeu complexe (ou simplement jouer pendant une durée assez longue pour ne pas regretter son achat), une forte motivation est nécessaire : une partie de mon protocole se base sur le cadre théorique proposé par la self-determination theory (STD) ou théorie de l'autodétermination afin de vérifier qu'au moins les joueurs seront motivés à explorer le jeu. Cette théorie est classiquement utilisée en psychologie cognitive appliquée au jeu vidéo et émet des postulats sur la motivation intrinsèque, plus complexe à appréhender que la motivation extrinsèque (la plupart des jeux implémentent naturellement des systèmes de récompense et de punition, par exemple vaincre un ennemi rapporte généralement des points, des objets dans le jeu...). La STD postule en particulier que répondre aux besoins d'autonomie (comme pouvoir choisir entre plusieurs voies pour atteindre un objectif, mais aussi personnaliser son avatar), de compétence (sensation de contrôle et de progression) et d'affiliation (création de liens avec les autres joueurs) va augmenter la motivation intrinsèque.
Pour tester le niveau de motivation des joueurs débutants et l'utilisabilité de l'interface (autrement dit, qu'elle soit à la fois facile à utiliser et agréable, avec par exemple des retours ou feedbacks satisfaisants), je dus réaliser sur un échantillon qualifié une étude de recherche UX exploratoire. Le but était notamment de trouver les éléments de frustration non voulus par le concepteur du jeu (un jeu peut être difficile d'un point de vue stratégique, mais il serait regrettable qu'il le soit du fait de son ergonomie).
Les principales questions que j'avais à l'esprit en construisant le matériel était donc :
- Où les joueurs regardent et que manquent-ils ? (idée étrangement inspirée par le "Chien de Baskerville", un roman avec Sherlock Holmes où ce dernier remarque que le chien n'a pas aboyé)
- Quels éléments d'interface génèrent de la confusion, des erreurs ou de la frustration ?
- Quel est l'état motivationnel des joueurs et comment évolue-t-il au fil du temps ?
- Quelles corrections sont à prioriser et pour quel ratio impact/coût ?
03 Méthodes utilisées
- Recrutement de 4 joueurs qualifiés (≈ 100 h sur une liste de jeux de stratégie définie avec le studio)
- Prétests du protocole avec 2 profils moins ciblés pour économiser les participants qualifiés, ajuster le protocole si nécessaire ne pas ignorer les problèmes ergonomiques qu'un joueur expérimenté pourrait éviter par habitude
- Tests playthrough (sessions d'environ 3 h)
- Observation avec grille (fonctionnalités utilisées, motivation via durée totale en jeu, si le joueur regarde autre chose que l'écran..., gameflow, émotions via expressions faciales ou vocales) et pensée à voix haute (think-aloud)
- Enregistrement vidéo via OBS, horloge incrustée pour la synchronisation
- Eye-tracking avec Tobii Eye Tracker 5 sans aucune couche logicielle prévue pour extraire ou traiter les données (fréquence exploitable 33Hz, procurant une précision suffisante d'après le théorème de Nyquist-Shannon)
- Création de heatmaps et de scanpaths
- Questionnaire GEQ, version In-game (plus courte : 14 items) administré aussi à 15 joueurs expérimentés pour comparer aux débutants
- Entretiens semi-directifs
04 Ce que j'ai observé
Malgré un échantillon de petite taille, les tests ont fait remonter des points de friction récurrents, générant la frustration des joueurs :
- des infobulles trop lentes à apparaître, leur durée étant de 1,25 s
- des traductions françaises manquantes qui cassent la compréhension ;
- des feedbacks insuffisants après les actions : les joueurs ne savaient pas toujours si une action avait réussi ou échoué ;
- une barre de séparation prise pour une barre de scroll, source d'erreurs de manipulation ;
- un niveau Defcon peu lisible du fait du choix de couleurs difficilement différenciables, alors qu'il structure la tension du jeu ;
- des images perçues comme cliquables qui ne l'étaient pas (affordance trompeuse) ;
- des changements de politique nationale déclenchés sans confirmation, aux conséquences lourdes et presque irréversibles.
En revanche, les résultats du GEQ ont semblé révéler que la frustration ressentie du fait du système de jeu exigeant (et non pas de son utilisabilité) n'était pas vue négativement par les joueurs même débutants (la tension et l'affect négatif restaient bas). Le GEQ en effet, en plus d'apporter un autre moyen de mesurer la motivation et l'immersion, la valence des affects ressentis, mesure la frustration et le challenge perçu. Autrement dit : une partie de la frustration fait partie du sel du jeu. Mon rôle en tant qu'UX researcher devait donc bien se borner à de chasser la frustration liée à l'interface, mais pas celle du gameplay.
De même l'entretien semi-directif portait notamment sur la motivation, le gameflow et les émotions ressenties. En plus de cela furent investigués la première et dernière impression, ce que l'utilisateur a aimé ou changerait dans le jeu, s'il compte y rejouer (avec une clé gratuite) ou encore quel serait le prix pour lequel il serait prêt à payer. Des questions qui intéressait bien évidemment le studio pour la commercialisation du jeu.
05 Recommandations & livrables
A l'issue des analyses, un rapport de recherche UX a été rédigé, composé d'une liste priorisée des points de frictions. Les recommandations ont volontairement été gardées simples, courtes et actionnables : le studio disposait de peu de temps de développement. L'objectif n'était pas de proposer une refonte ambitieuse et irréaliste, mais d'identifier des corrections à fort ratio impact/coût. Un développeur surchargé ne lit pas les longs rapports (et peut même l'annoncer clairement) : le livrable principal a donc pris la forme de tableaux priorisés par criticité, chaque point appuyé par des observations chiffrées (nombre d'utilisateurs concernés) et des références en psychologie cognitive et en ergonomie. Parmi les recommandations, quelques exemples issus des problèmes précédemment listés :
- réduire le délai d'apparition des infobulles à 500 ms maximum : le délai actuel de 1,25s dépasse la limite du flow de 1s selon Jon Nielsen (1993) dans son livre Usability Engineering. Plus récemment et précisément, Doherty & Sorenson (2008) dans Keeping Users in the Flow indiquent que des temps de réponse inférieur 500 ms augmentent significativement le sentiment de contrôle et l'engagement. La recommandation a été donc de passer le délai actuel au maximum à 500ms (on peut se contenter de la fourchette haute car on n'est pas sur le résultat d'une action, pour laquelle on recommanderait plutôt du 200ms, mais sur une infobulle qui ne doit pas s'afficher au moindre survol passager)
- corriger les traductions françaises manquantes ;
- renforcer les feedbacks audio et visuels après les actions, et mieux distinguer succès et échec ;
- ajouter une confirmation ou une annulation sur les changements de politique nationale (heuristiques d'utilisabilité "Prévention de l'erreur" et "Contrôle et liberté de l'utilisateur") ;
06 Impact & apprentissages
Plusieurs recommandations ont été implémentées pendant ou juste après le stage (malgré la charge importante qui pesait sur le développeur), notamment la réduction des délais d'infobulles et des corrections de traduction. Et l'effet a pu être vérifié : lors des derniers tests, plus aucune remarque spontanée sur la latence des infobulles, y compris quand les participants étaient interrogés dessus. La recherche a donc produit des effets concrets et mesurables sur le jeu.
Cette expérience m'a permis de me confronter à la réalité d'un studio indépendant, avec ses contraintes de temps et de moyens, et d'appliquer mes connaissances en UX Research dans un contexte réel. Cela s'est fait dans un contexte bienveillant et instructif, et j'ai pu profiter de la mise en abîme fascinante qu'est observer le dirigeant du studio élaborer une stratégie de vente de son jeu de stratégie.
07 Limites & méthodologiques
- Je n'ai pu réunir que 4 participants qualifiés, en-deçà du standard du milieu (une dizaine selon Hodent) : les joueurs correspondant à la cible se sont avérés difficiles à recruter. Une compensation pécuniaire, ou d'autres canaux (bars à jeux...) que les réseaux sociaux auraient pu aider.
- Les sessions de test étaient relativement courtes pour un jeu aussi complexe : cela a pu peser sur le sentiment de difficulté et de progression mesuré.
- Le Tobii Eye Tracker 5 n'est pas conçu pour la recherche académique. Les heatmaps ont finalement apporté peu d'informations exploitables (hormis confirmer que l'icône d'aide était bien perçue), et la comparaison expert/débutant resterait à objectiver par des statistiques inférentielles.