Résumé
Le myélome nécessite un suivi à long terme et se caractérise par des phases de rémission et de rechute, pendant lesquelles un marqueur est surveillé et sert de base à une politique de traitement. Nous modélisons la dynamique du marqueur par un Processus Markovien Déterministe par Morceaux contrôlé à observations bruitées, espace d'état continu et à modèle partiellement connu et nous proposons une nouvelle méthode de contrôle pour ce PDMP. Nous transformons ce problème en Processus de Décision Markovien Partiellement Observé à espace d'état continu, sur lequel nous mettons en oeuvre un algorithme d'apprentissage par renforcement profond. Nous montrons expérimentalement sur des trajectoires de marqueur simulées que cet algorithme permet une prise de décision efficace.