Pour apprendre, la carotte mieux que le baton.Les chercheurs le démontrent
Une équipe de recherche du CNRS (France) a découvert récemment un algorithme permettant au cerveau humain d’apprendre à éviter des punitions aussi efficacement qu’il apprend à rechercher des récompenses. La clef de voûte de cet algorithme — appelé « RELATIVE » — consiste à calculer les résultats des actions de manière dépendante du contexte dans lequel le résultat est obtenu. Ainsi, dans l’apprentissage par punition, le résultat d’une action qui a une valeur nulle (voire légèrement négative) — se cacher dans un trou — est rapporté au contexte dans lequel ce résultat a été obtenu, qui a une valeur très négative — être poursuivi par un prédateur. Si l’on considère que la valeur de l’action est plus grande que la valeur moyenne du contexte, le bon choix acquiert ainsi une valeur « relative » positive. Il permet donc un apprentissage par récompense aussi bien que par punition.
source: CNRS France 24 septembre 2015