Toutes les news taguées avec ce sujet.
Une approche en deux étapes qui sépare compétence motrice et alignement sémantique pour réduire drastiquement le besoin en données expertes.
Une nouvelle méthode remplace les signaux scalaires classiques de l'imitation learning par des critiques en langage naturel pour guider l'apprentissage de politiques robustes.