Le prompting par chaîne de pensée a démontré que les grands modèles de langage pouvaient résoudre des problèmes de raisonnement complexes en travaillant par étapes intermédiaires. Cependant, cette approche reposait sur un seul chemin de raisonnement – si ce chemin contenait une erreur, la réponse finale serait probablement incorrecte. L'auto-cohérence résout cette limitation en générant plusieurs chemins de raisonnement indépendants sur le même problème et en sélectionnant la réponse qui apparaît le plus fréquemment sur ces trajectoires diverses. Le modèle lui-même reste inchangé ; seule la stratégie de décodage diffère, sans nécessiter d'entraînement supplémentaire, d'ajustement fin ou de supervision.

Des chercheurs de Google Research ont présenté ces travaux à l'ICLR 2023, montrant des améliorations substantielles sur des tâches de raisonnement arithmétique, de bon sens et symbolique. La technique s'inspire de la résolution de problèmes humains : face à des questions difficiles, les gens envisagent généralement plusieurs approches avant de choisir la réponse la plus convaincante. L'auto-cohérence applique ce principe aux modèles de langage, exploitant plus efficacement les capacités de raisonnement qu'ils possèdent déjà.

L'importance de cet article réside dans la démonstration que les gains de performance ne doivent pas nécessairement provenir de modèles plus grands. Au contraire, un meilleur raisonnement émerge d'une utilisation plus intelligente des capacités existantes. Ce travail a marqué un tournant dans la recherche sur les LLM vers les stratégies de raisonnement au moment du décodage et a influencé les développements ultérieurs en vérification, inférence basée sur la recherche, et modèles de langage orientés vers le raisonnement.