Photo de Taehyun Cho

Taehyun Cho

Chercheur postdoctoral émérite Vector

Mes recherches portent sur la prise de décision séquentielle en situation d'incertitude, notamment dans le contexte du retour d'information humain. J'ai étudié en profondeur l'apprentissage par renforcement distributionnel (DistRL), l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF) et l'analyse des regrets, dans le but de faire le lien entre la théorie et la pratique.

Mon objectif à long terme est de concevoir des agents centrés sur l'humain et socialement conscients : des systèmes capables de raisonner sur les individus, de comprendre la dynamique des interactions humaines et d'agir en fonction de leurs préférences, valeurs et décisions. Je m'inspire de la façon dont les humains prennent des décisions. En cherchant à comprendre les mécanismes cognitifs qui sous-tendent les choix humains et en modélisant mathématiquement la structure qui régit l'interaction, je vise à développer à la fois des connaissances théoriques et des algorithmes pratiques pour une prise de décision robuste en situation d'incertitude.

Intérêts de recherche

  • Apprentissage par renforcement
  • Prise de décision séquentielle en situation d'incertitude
  • Conscient socialement, alignement humain

Points saillants

  • (ICML 2026 Spotlight, Top 2,2 %) Un cadre de minimisation des regrets pour l'apprentissage des préférences dans les grands modèles de langage
  • (ICML 2025 Spotlight, Top 2,6 %) Apprentissage des préférences étiquetées par politique : les préférences suffisent-elles pour l’apprentissage par renforcement à long terme ?
  • (ICML 2025) Absence de biais de Bellman : vers un apprentissage par renforcement distributionnel prouvé efficace avec approximation générale de la fonction de valeur
  • (NeurIPS 2023) Piège de l'optimisme : apprentissage par renforcement distributionnel par randomisation du critère de risque