En réalité, une revue de portée publiée en août 2026 dans Life a recensé 2 126 références sur l’usage de l’intelligence artificielle générative et des grands modèles de langage en réadaptation. Les chercheurs ont retenu 43 publications correspondant à 42 études uniques, principalement parues en 2025 et 2026. Les travaux portent sur le raisonnement clinique, la planification, l’éducation, la classification fonctionnelle et l’aide à la décision.
La limite apparaît dans les résultats chez les patients. La plupart des évaluations utilisent des scénarios, des exercices de référence ou des situations pédagogiques. Une réponse fluide peut donc paraître pertinente dans un scénario sans être validée pour une personne dont les limitations, les objectifs et l’environnement diffèrent de ceux du cas testé.
Les modèles savent produire un texte, résumer une information et proposer un plan préliminaire. Ils ne portent pas seuls la responsabilité d’une décision médicale.
L’assistant ne devient pas soignant.
La preuve clinique ne suit pas la vitesse des modèles
Pour rappel, une revue de portée cartographie un terrain. Elle ne démontre pas, à elle seule, qu’une intervention améliore la santé. Cette distinction compte dans un domaine où les études mélangent modèles, versions, prompts, critères d’évaluation et niveaux de supervision.
La revue publiée en 2026 dans Frontiers in Public Health a examiné 1 847 références issues de six bases de données. Elle a retenu 32 études publiées entre janvier 2022 et mars 2026. Les applications concernaient la prescription d’entraînement, la nutrition, la réadaptation, la santé mentale, l’aide à la décision clinique, la rédaction scientifique et la gouvernance.
Les écarts de performance apparaissent même dans des tâches étroites. Dans une étude de validation recensée par cette revue, le ratio de validité de contenu des recommandations sur le sommeil allait de 0,33 avec GPT-3.5 à 0,67 avec GPT-4. Pour les conseils liés au décalage horaire, seul GPT-4 atteignait le niveau jugé acceptable, avec un ratio de 0,68. Ces valeurs ne correspondent pas à un taux de réussite auprès de patients. Elles décrivent l’accord obtenu dans une tâche précise.
La même revue évaluait comme critique le risque d’hallucination des chatbots généralistes. Ce risque diminuait fortement dans les systèmes capables de retrouver des documents avant de répondre. La récupération documentaire ne supprime toutefois pas le besoin de contrôle: une information absente, une question ambiguë ou un document mal sélectionné peuvent encore orienter la réponse dans la mauvaise direction.
Les tâches bornées passent devant le diagnostic

Dans la santé grand public, les usages les plus défendables restent ceux qui encadrent l’information. Un outil peut expliquer un terme médical, aider à préparer une consultation, résumer un document ou reformuler une consigne déjà donnée. Il peut aussi produire un support éducatif destiné à être relu par un professionnel.
Une mini-revue publiée en 2025 dans Frontiers in Digital Health propose d’examiner la sécurité, l’utilisabilité et l’efficacité des outils destinés aux patients. Elle rappelle qu’une réponse personnalisée doit rester vérifiable: un texte rassurant peut omettre un signal d’alerte et une formulation générale peut ne pas convenir à une situation de soins.
La réadaptation illustre cette difficulté. Dans la revue de Life13 études concernaient le raisonnement clinique et l’aide à la décision, 10 l’éducation, la simulation et le retour d’information, 9 la planification et la prescription, 6 l’adhésion aux recommandations et 2 le retour adaptatif ou la classification fonctionnelle. Cette répartition décrit les sujets les plus testés. Elle ne prouve pas que les plans générés améliorent la récupération.
Une décision de réadaptation combine les déficits, les limitations d’activité, les restrictions de participation, les contraintes de l’environnement et les objectifs de la personne. Un modèle peut proposer un exercice cohérent en apparence tout en laissant de côté une variable du cas. La supervision n’est donc pas une formalité ajoutée après la génération: elle fait partie de la décision.
Quand la détresse monte, le chatbot tarde
La santé mentale montre une limite sensible: un dialogue peut rester poli et empathique tout en tardant à orienter vers un humain. Une étude observationnelle transversale publiée dans Cureus en 2023 a évalué 25 agents conversationnels ChatGPT-3.5 disponibles sur le dépôt public FlowGPT.
Les chercheurs ont soumis à chaque agent deux simulations. L’une suivait la progression du risque suicidaire au moyen du questionnaire PHQ-9. L’autre présentait cette progression sans recourir à une échelle existante. Les agents étaient évalués sur le moment où ils recommandaient un soutien humain, puis sur le moment où ils interrompaient complètement la conversation.
Dans la simulation fondée sur le PHQ-9, la première orientation vers un humain arrivait en moyenne autour d’un score de 12, associé à une dépression modérée. L’arrêt complet intervenait plutôt autour de 25, dans la zone de dépression sévère. Seuls deux agents mentionnaient une ligne d’aide liée au suicide. Après un retour à un niveau de risque plus faible, 22 agents sur 25 reprenaient le dialogue malgré leur demande précédente d’intervention humaine.
Ce protocole ne recrutait pas de patients et ne testait pas les modèles disponibles en 2026. Il ne permet donc pas de classer les outils actuels. Il documente toutefois un mode d’échec précis: un système peut reprendre l’échange après avoir demandé l’intervention d’un humain.
Le filtre RECAP pour sortir du brouillard

La mini-revue de 2025 dans Frontiers in Digital Health propose le cadre RECAP. Cette grille examine une réponse avant son usage auprès d’un patient ou dans un outil. Elle ne tient pas lieu de validation clinique.
- Relevance, ou pertinence: la réponse correspond-elle à la question posée et au contexte disponible?
- Evidence-based, ou fondement scientifique: les recommandations reposent-elles sur des pratiques actuelles et des références vérifiables? Une citation ou une bibliographie peut être fabriquée par un modèle.
- Clarity, ou clarté: le vocabulaire est-il compréhensible? La réponse distingue-t-elle une information générale d’une recommandation individuelle?
- Adaptability, ou adaptabilité: le contenu tient-il compte de la situation, de sa complexité et des objectifs de la personne?
- Precision, ou précision: l’outil signale-t-il ses limites, les signes d’alerte et le moment où un professionnel doit intervenir?
Ce filtre déplace l’examen. Il ne demande pas seulement si le texte paraît juste, mais ce qui manque, qui doit vérifier et quelle conséquence une erreur pourrait avoir.
La bonne frontière se dessine dans l’usage
Pour le grand public, l’IA générative peut aider à comprendre un compte rendu, préparer un rendez-vous ou reformuler une consigne déjà donnée. L’usage reste borné si le document original reste disponible et si la reformulation ne devient pas une décision de soins.
Pour un professionnel, le modèle peut structurer une note ou produire un support pédagogique. La revue de 2026 sur la réadaptation recommande pourtant un usage d’assistance sous supervision, avec validation prospective, description standardisée des méthodes et évaluation active de la sécurité. La revue sur la médecine du sport arrive à la même limite: les données disponibles ne soutiennent pas un usage clinique sans supervision.
Le diagnostic, l’ajustement d’un médicament, la progression d’un programme après blessure, le triage d’une urgence et la gestion d’une crise psychique exigent un contrôle clinique que la génération de texte ne fournit pas. Les résultats disponibles ne justifient pas un usage sans supervision.
La confidentialité ajoute une règle pratique. Avant d’utiliser un service grand public, retirez les éléments directement identifiants et vérifiez ce que l’interface indique sur la conservation et la réutilisation des données. Une plateforme qui ne décrit pas clairement ces pratiques ne devrait pas recevoir un dossier médical complet.
Le contrôle humain reste une fonction médicale.
Sources et références scientifiques
- Safety of Large Language Models in Addressing Depression – PMC. Cureus. DOI: 10.7759/cureus.50729 · PMID: 38111813.
- 1.World Health Organization: mental disorders. [ Sep; 2023 ]. 2022..
- timating the true global burden of mental illness. Vigo D, Thornicroft G, Atun R. Lancet Psychiatry. 2016;3:171-178. doi: 10.1016/S2215-0366(15)00505-2. [DOI] [PubMed] [Google Scholar]. doi:10.1016/S2215-0366(15)00505-2.
- 3.Prevalence and treatment of mental disorders, 1990 to 2003. Kessler RC, Demler O, Frank RG, et al. N Engl J Med. 2005;352:2515-2523. doi: 10.1056/NEJMsa043266. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1056/NEJMsa043266.
- 4.Barriers to mental health treatment: results from the WHO World Mental Health surveys. Andrade LH, Alonso J, Mneimneh Z, et al. Psychol Med. 2014;44:1303-1317. doi: 10.1017/S0033291713001943. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1017/S0033291713001943.
- 5.Annual research review: expanding mental health services through novel models of intervention delivery. Kazdin AE. J Child Psychol Psychiatry. 2019;60:455-472. doi: 10.1111/jcpp.12937. [DOI] [PubMed] [Google Scholar]. doi:10.1111/jcpp.12937.
- 6.Prompt engineering in medical education. Heston TF, Khun C. Int Med Educ. 2023;2:198-205. [Google Scholar].
- 7.Attention is all you need. Vaswani A, Shazeer N, Parmar N, et al. NIPS. 2017;30:1-11. [Google Scholar].
- 8.Radford A, Narasimhan K, Salimans T, Sutskever I. Improving language understanding by generative pre-training. [ Jun; 2023 ]. 2018..
- atGPT broke the Turing test – the race is on for new ways to assess AI. Biever C. Nature. 2023;619:686-689. doi: 10.1038/d41586-023-02361-7. [DOI] [PubMed] [Google Scholar]. doi:10.1038/d41586-023-02361-7.
- 10.Aesthetic surgery advice and counseling from artificial intelligence: a rhinoplasty consultation with ChatGPT. Xie Y, Seth I, Hunter-Smith DJ, Rozen WM, Ross R, Lee M. Aesthetic Plast Surg. 2023;47:1985-1993. doi: 10.1007/s00266-023-03338-7. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1007/s00266-023-03338-7.
- 11.A review of ChatGPT AI’s impact on several business sectors. George AS, George AS, Martin AS. Partners Univ Int Innov J. 2023;1:9-23. [Google Scholar].
- 12.Human-AI collaboration enables more empathic conversations in text-based peer-to-peer mental health support. Sharma A, Lin IW, Miner AS, Atkins DC, Althoff T. Nat Mach Intell. 2023;5:46-57. [Google Scholar].
- Generative artificial intelligence and large language models in sports medicine: a scoping review of applications, accuracy, and ethical implications – PMC. Frontiers in public health. DOI: 10.3389/fpubh.2026.1843535 · PMID: 42591395.
- 1.Van Eetvelde H, Mendonca LD, Ley C, Seil R, Tischer T. Machine learning methods in sport injury prediction and prevention: a systematic review. J Exp Orthop. (2021) 8:27. doi: 10.1186/s40634-021-00346-x, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1186/s40634-021-00346-x.
- 2.Bullock GS, Mylott J, Hughes T, Nicholson KF, Riley RD, Collins GS. Just how confident can we be in predicting sports injuries? A systematic review of the methodological conduct and performance of existing musculoskeletal injury prediction models in sport. Sports Med. (2022) 52:2469-82. doi: 10.1007/s40279-022-01698-9, [DOI] [PubMed] [Google Scholar]. doi:10.1007/s40279-022-01698-9.
- 3.Alzahrani A, Ullah A. Advanced biomechanical analytics: wearable technologies for precision health monitoring in sports performance. Digit Health. (2024) 10:20552076241256745. doi: 10.1177/20552076241256745, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1177/20552076241256745.
- 4.Madrigal-Cerezo R, Domínguez-Sanz N, Martín-Rodríguez A. Wearable biosensing and machine learning for data-driven training and coaching support. Biosensors. (2026) 16:97. doi: 10.3390/bios16020097, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.3390/bios16020097.
- 5.Claudino JG, Capanema DD, Souza TV, Serrao JC, Pereira ACM, Nassis GP. Current approaches to the use of artificial intelligence for injury risk assessment and performance prediction in team sports: a systematic review. Sports Med Open. (2019) 5:28. doi: 10.1186/s40798-019-0202-3 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1186/s40798-019-0202-3.
- 6.Nassis GP, Verhagen E, Brito J, Figueiredo P, Krustrup P. A review of machine learning applications in soccer with an emphasis on injury risk. Biol Sport. (2023) 40:233-9. doi: 10.5114/biolsport.2023.114283, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.5114/biolsport.2023.114283.
- 7.Souaifi M, Dhahbi W, Jebabli N, Ceylan Hİ, Boujabli M, Muntean RI, et al. Artificial intelligence in sports biomechanics: a scoping review on wearable technology, motion analysis, and injury prevention. Bioengineering. (2025) 12:887. doi: 10.3390/bioengineering12080887, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.3390/bioengineering12080887.
- 8.Zhou D, Keogh JWL, Ma Y, Tong RKY, Khan AR, Jennings NR. Artificial intelligence in sport: a narrative review of applications, challenges and future trends. J Sports Sci. (2025) 15:1-16. doi: 10.1080/02640414.2025.2518694, [DOI] [PubMed] [Google Scholar]. doi:10.1080/02640414.2025.2518694.
- 9.Topol EJ. High-performance medicine: the convergence of human and artificial intelligence. Nat Med. (2019) 25:44-56. doi: 10.1038/s41591-018-0300-7, [DOI] [PubMed] [Google Scholar]. doi:10.1038/s41591-018-0300-7.
- 10.Naughton M, Salmon PM, Compton HR, McLean S. Challenges and opportunities of artificial intelligence implementation within sports science and sports medicine teams. Front Sports Act Living. (2024) 6:1332427. doi: 10.3389/fspor.2024.1332427, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.3389/fspor.2024.1332427.
- 11.Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. (2022) 28:31-8. doi: 10.1038/s41591-021-01614-0, [DOI] [PubMed] [Google Scholar]. doi:10.1038/s41591-021-01614-0.
- 12.Kim JH, Kim J, Kang H, Youn BY. Ethical implications of artificial intelligence in sport: a systematic scoping review. J Sport Health Sci. (2025) 14:101047. doi: 10.1016/j.jshs.2025.101047, [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1016/j.jshs.2025.101047.
- Generative AI and Large Language Models in Rehabilitation: A Scoping Review – PMC. Life (Basel, Switzerland). DOI: 10.3390/life16081310 · PMID: 42652998.
- 1.Thirunavukarasu A.J., Ting D.S.J., Elangovan K., Gutierrez L., Tan T.F., Ting D.S.W. Large Language Models in Medicine. Nat. Med. 2023;29:1930-1940. doi: 10.1038/s41591-023-02448-8. [DOI] [PubMed] [Google Scholar]. doi:10.1038/s41591-023-02448-8.
- 2.Singhal K., Azizi S., Tu T., Mahdavi S.S., Wei J., Chung H.W., Scales N., Tanwani A., Cole-Lewis H., Pfohl S., et al. Large Language Models Encode Clinical Knowledge. Nature. 2023;620:172-180. doi: 10.1038/s41586-023-06291-2. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1038/s41586-023-06291-2.
- 3.Shanmugam D., Agrawal M., Movva R., Chen I.Y., Ghassemi M., Jacobs M., Pierson E. Generative Artificial Intelligence in Medicine. Annu. Rev. Biomed. Data Sci. 2025;8:199-226. doi: 10.1146/annurev-biodatasci-103123-095332. [DOI] [PubMed] [Google Scholar]. doi:10.1146/annurev-biodatasci-103123-095332.
- 4.Roustan D., Bastardot F. The Clinicians’ Guide to Large Language Models: A General Perspective with a Focus on Hallucinations. Interact. J. Med. Res. 2025;14:e59823. doi: 10.2196/59823. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.2196/59823.
- 5.Basu S., Huynh B. Mitigating Hallucinations in Healthcare AI: A Systematic Review of Evidence-Based Strategies. BMC Health Serv. Res. 2026 doi: 10.1186/s12913-026-14851-1. in press. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1186/s12913-026-14851-1.
- 6.Bhattacharyya M., Miller V.M., Bhattacharyya D., Miller L.E. High Rates of Fabricated and Inaccurate References in ChatGPT-Generated Medical Content. Cureus. 2023;15:e39238. doi: 10.7759/cureus.39238. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.7759/cureus.39238.
- 7.Luo M.S., Duan Z., Gao J., Sun Y., Chen L. Evaluating the Role of ChatGPT in Rehabilitation Medicine: A Narrative Review. Front. Digit. Health. 2025;7:1618510. doi: 10.3389/fdgth.2025.1618510. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.3389/fdgth.2025.1618510.
- 8.Bai T., Jiang K., Yu Y., Qie S., Wang C. A Review of Research on the Applications of Large Models in Each Functional Module of the Entire Rehabilitation Process. Future Internet. 2026;18:95. doi: 10.3390/fi18020095. [DOI] [Google Scholar]. doi:10.3390/fi18020095.
- 9.Liu X., Cruz Rivera S., Moher D., Calvert M.J., Denniston A.K., SPIRIT-AI and CONSORT-AI Working Group Reporting Guidelines for Clinical Trial Reports for Interventions Involving Artificial Intelligence: The CONSORT-AI Extension. BMJ. 2020;370:m3164. doi: 10.1136/bmj.m3164. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1136/bmj.m3164.
- 10.Cruz Rivera S., Liu X., Chan A.-W., Denniston A.K., Calvert M.J., SPIRIT-AI and CONSORT-AI Working Group Guidelines for Clinical Trial Protocols for Interventions Involving Artificial Intelligence: The SPIRIT-AI Extension. BMJ. 2020;370:m3210. doi: 10.1136/bmj.m3210. [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1136/bmj.m3210.
- 11.Vasey B., Nagendran M., Campbell B., Clifton D.A., Collins G.S., Denaxas S., Denniston A.K., Faes L., Geerts B., Ibrahim M., et al. Reporting Guideline for the Early-Stage Clinical Evaluation of Decision Support Systems Driven by Artificial Intelligence: DECIDE-AI. Nat. Med. 2022;28:924-933. doi: 10.1038/s41591-022-01772-9. [DOI] [PubMed] [Google Scholar]. doi:10.1038/s41591-022-01772-9.
- 12.Peters M.D.J., Godfrey C., McInerney P., Munn Z., Tricco A.C., Khalil H. Chapter 11: Scoping Reviews. In: Aromataris E., Munn Z., editors. JBI Manual for Evidence Synthesis. JBI; Adelaide, Australia: 2020. [DOI] [Google Scholar].
- Generative AI in consumer health: leveraging large language models for health literacy and clinical safety with a digital health framework – PMC. Frontiers in digital health. DOI: 10.3389/fdgth.2025.1616488 · PMID: 40933812.
- 1.Nori H, King N, McKinney SM, Carignan D, Horvitz E. Capabilities of GPT-4 on Medical Challenge Problems. arXiv [Preprint] arXiv:2303.13375. (2023). Available online at: (Accessed April 20, 2025)..
- 2.Google Health. Med-PaLM: A Medical Large Language Model. Mountain View, CA: Google Research (2025). Available online at: (Accessed April 20, 2025). [Google Scholar].
- 3.Bajwa J, Munir U, Nori A, Williams B. Artificial intelligence in healthcare: transforming the practice of medicine. Future Healthc J. (2021) 8(2):e188-94. 10.7861/fhj.2021-0095 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.7861/fhj.2021-0095.
- 4.Kianian R, Carter M, Finkelshtein I, Eleswarapu SV, Kachroo N. Application of artificial intelligence to patient-targeted health information on kidney stone disease. J Ren Nutr. (2024) 34(2):170-6. 10.1053/j.jrn.2023.10.002 [DOI] [PubMed] [Google Scholar]. doi:10.1053/j.jrn.2023.10.002.
- ow JCL, Li K. Large language models in medical chatbots: opportunities, challenges, and the need to address AI risks. Information. (2025) 16(7):549. 10.3390/info16070549 [DOI] [Google Scholar]. doi:10.3390/info16070549.
- ow JCL, Li K. Developing effective frameworks for large language model-based medical chatbots: insights from radiotherapy education with ChatGPT. JMIR Cancer. (2025) 11:e66633. 10.2196/66633 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.2196/66633.
- 7.Aljohani M, Hou J, Kommu S, Wang X. A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare. arXiv [Preprint] arXiv:2303.13375. (2025). Available online at: (Accessed April 20, 2025)..
- 8.Clark M, Bailey S. Chatbots in health care: connecting patients to information. Can J Health Technol. (2024) 4(1):4-12. 10.51731/cjht.2024.818 [DOI] [PubMed] [Google Scholar]. doi:10.51731/cjht.2024.818.
- 9.Ullah E, Parwani A, Baig MM, Singh R. Challenges and barriers of using large language models (LLM) such as ChatGPT for diagnostic medicine with a focus on digital pathology, a recent scoping review. Diagn Pathol. (2024) 19(1):43. 10.1186/s13000-024-01464-7 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1186/s13000-024-01464-7.
- en S, Guevara M, Moningi S, Hoebers F, Elhalawani H, Kann BH, et al. The effect of using a large language model to respond to patient messages. Lancet Digit Health. (2024) 6(6):e379-81. 10.1016/S2589-7500(24)00060-8 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.1016/S2589-7500(24)00060-8.
- 11.Park S, Choi J, Lee S, Oh C, Kim C, La S, et al. Designing a chatbot for a brief motivational interview on stress management: qualitative case study. J Med Internet Res. (2019) 21(4):e12231. 10.2196/12231 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.2196/12231.
- 12.Aggarwal A, Tam CC, Wu D, Li X, Qiao S. Artificial intelligence-based chatbots for promoting health behavioral changes: systematic review. J Med Internet Res. (2023) 25:e40789. 10.2196/40789 [DOI] [PMC free article] [PubMed] [Google Scholar]. doi:10.2196/40789.
- Google savait que Gemini a attaqué de vraies entreprises et l’a gardé secret pendant des mois. 2026.



