La reconnaissance de la parole ne passe pas toujours par un microphone. Un masque RFID peut exploiter un signal radio lié aux mouvements des lèvres; un capteur souple peut suivre la pression associée aux mouvements des muscles de la gorge. Un badge audio, lui, enregistre une conversation avant de la transcrire.
Ces approches ne produisent pas le même résultat. Les deux premières classent des voyelles, des mots ou des phrases à partir d’un signal physique. Le badge traite une conversation enregistrée et en extrait une transcription, un résumé ou des tâches.
Un masque lit un signal radio. Un capteur suit une pression. Un badge conserve l’audio.
Le capteur ne suffit pas.
La bouche devient une antenne RFID
Pour rappel, dans un article de Scientific Reports accepté le 29 novembre 2024, les chercheurs décrivent un masque RFID capable d’analyser les mouvements des lèvres sous un masque. L’étiquette recueille les données d’un signal radio, puis des modèles d’apprentissage automatique les classent.
Le protocole comprend cinq voyelles, A, E, I, O et U, quatre consonnes, F, G, M et S, ainsi que cinq mots anglais, Fish, Goat, Meal, Moon et Snake. Sur l’ensemble RFID combiné, le modèle Random Forest atteint une précision de 80 %.
Ce score mesure la capacité à distinguer les catégories prévues dans cette expérience. Il ne mesure pas la compréhension d’une phrase libre ni d’une conversation complète. Le jeu d’essai reste limité à ces voyelles, consonnes et mots.
La méthode utilise un signal radio au lieu d’une image des lèvres. L’étude rappelle que les approches par caméra sont sensibles à l’éclairage et à l’occlusion, tandis que les appareils portés sur le visage peuvent gêner l’utilisateur. Elle ne permet pas pour autant de passer directement d’un vocabulaire fermé à une conversation libre.
La gorge entre dans la reconnaissance de la parole
En réalité, la bouche n’est pas la seule zone exploitable. Une publication parue le 26 décembre 2022 dans ACS Applied Materials & Interfaces décrit un capteur de pression flexible fabriqué avec du disulfure de molybdène, de l’hydroxyéthylcellulose et une éponge en polyuréthane.
Le capteur présente une sensibilité de 0,746 kPa-1une plage de détection de 250 kPa, un temps de réponse de 120 millisecondes et une répétabilité testée sur 2 000 cycles. Une matrice de capteurs peut aussi représenter une répartition de pression et reconnaître l’écriture de chiffres arabes.
Pour la parole, le dispositif exploite les mouvements des muscles de la gorge. Avec un algorithme SVM, il reconnaît sept mots avec une précision de 97,14 %. Ce taux ne se compare pas directement aux 80 % du masque RFID: le capteur, le vocabulaire et le protocole changent.
Une autre publication, parue le 20 décembre 2025 dans Journal of Colloid and Interface Sciencedécrit un capteur souple à structure poreuse hiérarchique. Sa fabrication combine impression 3D et électrofilage. L’encre conductrice associe des MXene, des nanofils d’argent et du polydiméthylsiloxane, avec de la silice nanométrique.
Le capteur atteint une sensibilité de 0,813 kPa-1des temps de réponse annoncés de 37 et 30 millisecondes, ainsi qu’une limite de détection de 1,47 Pa. Il suit plusieurs mouvements physiologiques et reconnaît plusieurs phrases prononcées avec une précision de 94,9 % grâce à des algorithmes d’apprentissage profond.
Les 94,9 % et les 97,14 % ne répondent pas à la même question. Le premier résultat porte sur plusieurs phrases et un capteur différent; le second porte sur sept mots et un algorithme SVM. Dans les deux cas, le vocabulaire testé fixe une limite au résultat.
Le smartphone transcrit, puis classe

Une étude publiée le 27 mars 2024 dans Journal of Affective Disorders ne mesure ni les lèvres ni les muscles de la gorge. Elle analyse 3 919 réponses parlées en anglais recueillies par smartphone auprès de 265 participants ayant des antécédents de dépression.
Les chercheurs ont transcrit les enregistrements avec Whisper, puis utilisé BERTopic pour identifier les principaux thèmes. Le traitement en a fait ressortir 29. Six ont été associés au risque de dépression dans cette cohorte: No ExpectationsSleepMental TherapyHaircutStudying et Coursework.
Les participants qui mentionnaient ces thèmes présentaient une variabilité du sommeil plus élevée, un endormissement plus tardif et moins de pas quotidiens. Leurs enregistrements contenaient aussi moins de mots, davantage de langage négatif et moins de termes liés aux loisirs.
Ces résultats décrivent des associations statistiques. Ils ne permettent pas de conclure qu’un thème ou une phrase provoque une dépression. La portée reste liée à la cohorte étudiée, à la consigne de parole et à la taille réduite de certains groupes thématiques; une validation sur des ensembles plus vastes est nécessaire.
Le badge écoute, puis organise
Le MindClip IA de SwitchBot a été présenté à l’IFA 2026 et commercialisé le 3 septembre 2026 au prix de 120 euros. Ce badge se fixe au col d’une chemise, à une veste ou à la sangle d’un sac. Il enregistre les conversations, puis l’application produit une transcription, un résumé, des points clés et une liste d’actions.
Le boîtier pèse 16,8 grammes. La fiche du produit annonce plus de 20 heures d’enregistrement continu, 64 Go de stockage local et une portée de captation pouvant atteindre 3 mètres. Le badge peut distinguer plusieurs voix et identifier les locuteurs afin d’associer une tâche ou une échéance à la bonne personne.
L’application organise les informations en chronologie, en priorités, en souvenirs quotidiens ou en bilan hebdomadaire. Les tâches peuvent être synchronisées avec les agendas Google et Apple, ainsi qu’avec Rappels. La fonction Ask AI permet d’interroger les conversations passées en langage naturel. Le service peut aussi s’appuyer sur ChatGPT, Gemini et Claude Opus pour certaines fonctions d’organisation.
Le prix de 120 euros comprend 300 minutes par mois de transcription et de services d’intelligence artificielle. Au-delà, les abonnements commencent à 18 euros par mois ou 100 euros par an. Le produit est présenté avec un chiffrement de bout en bout, des transferts protégés et la possibilité de supprimer les contenus depuis l’application. Un voyant clignote pendant l’enregistrement, qui peut être lancé ou interrompu depuis l’appareil.
Le masque RFID et les capteurs de pression partent d’un signal physique pour classer des catégories de parole. Le MindClip part d’un enregistrement audio et cherche ensuite les mots, les locuteurs et les tâches. Les deux approches ne posent donc pas le même problème de mesure.
Les pourcentages ne parlent pas de la même chose
Les scores de 80 %, 97,14 % et 94,9 % proviennent d’expériences distinctes. Le masque teste des voyelles, des consonnes et cinq mots. Le capteur de gorge teste sept mots. Le capteur à structure poreuse teste plusieurs phrases. Un taux élevé dans l’un de ces protocoles ne mesure pas la compréhension d’une réunion.
Les publications disponibles testent donc des classes définies, des mots, des phrases ou des thèmes issus de parole enregistrée. Le MindClip ajoute une couche pratique, avec transcription et organisation de conversations, mais il repose sur une capture audio. La frontière entre les approches reste nette.
Les pourcentages restent attachés à leur protocole.
Sources et références scientifiques
- Artificial intelligence enabled smart mask for speech recognition for future hearing devices – PMC. Scientific reports. DOI: 10.1038/s41598-024-81904-y · PMID: 39627338.
- 1.WHO. Deafness and Hearing Loss. Accessed 17 Apr 2023..
- 2.Rashbrook, E. & Perkins, C. UK Health Security Agency, Health Matters: Hearing Loss Across the Life Course. Accessed 17 Apr 2023..
- 3.Potamianos, G., Neti, C., Luettin, J. & Matthews, I. Audio-visual automatic speech recognition: An overview. Issues Vis. Audio-Vis. Speech Process.22, 23 (2004). [Google Scholar].
- 4.Talha, K. S., Wan, K., Za’Ba, S. & Razlan, Z. M. Speech analysis based on image information from lip movement. In IOP Conference Series: Materials Science and Engineering, vol. 53, p. 012016 (IOP Publishing, 2013)..
- 5.Kastaniotis, D., Tsourounis, D. & Fotopoulos, S. Lip reading modeling with temporal convolutional networks for medical support applications. In 2020 13th International Congress on Image and Signal Processing, BioMedical Engineering and Informatics (CISP-BMEI) 366-371 (2020)..
- 6.Lan, Y., Theobald, B.-J., Harvey, R., Ong, E.-J. & Bowden, R. Improving visual features for lip-reading. In Auditory-Visual Speech Processing 2010 (2010)..
- 7.Duchnowski, P., Meier, U. & Waibel, A. See me, hear me: Integrating automatic speech recognition and lip-reading. In ICSLP, vol. 94, p. 547-550 (Citeseer, 1994)..
- 8.Bharati, S., Mondal, M. R. H. & Podder, P. A review on explainable artificial intelligence for healthcare: Why, how, and when? IEEE Trans. Artific. Intell. (2023)..
- 9.Fernandez-Lopez, A. & Sukno, F. M. Survey on automatic lip-reading in the era of deep learning. Image Vis. Comput.78, 53-72 (2018). [Google Scholar].
- 10.Kumar, K., Chen, T. & Stern, R. M. Profile view lip reading. In 2007 IEEE International Conference on Acoustics, Speech and Signal Processing-ICASSP’07, vol. 4, p. IV-429 (IEEE, 2007)..
- 11.Hameed, H. et al. Pushing the limits of remote RF sensing by reading lips under the face mask. Nat. Commun.13, 5168 (2022). [DOI] [PMC free article] [PubMed] [Google Scholar].
- 12.Ge, Y. et al. A Large-scale Multimodal Dataset of Human Speech Recognition. arXiv preprint arXiv:2303.08295 (2023)..
- Chen X, Zhang D, Luan H, Yang C, Yan W, Liu W.. Flexible Pressure Sensors Based on Molybdenum Disulfide/Hydroxyethyl Cellulose/Polyurethane Sponge for Motion Detection and Speech Recognition Using Machine Learning.. ACS applied materials & interfaces. 2022. DOI: 10.1021/acsami.2c16730 · PMID: 36571453. (résumé scientifique structuré; texte intégral non fourni)
- Zhang Y, Folarin AA, Dineley J, Conde P, de Angel V, Sun S, Ranjan Y, Rashid Z, Stewart C, Laiou P, Sankesara H, Qian L, Matcham F, White K, Oetzmann C, Lamers F, Siddi S, Simblett S, Schuller BW, Vai. Identifying depression-related topics in smartphone-collected free-response speech recordings using an automatic speech recognition system and a deep learning topic model.. Journal of affective disorders. 2024. DOI: 10.1016/j.jad.2024.03.106 · PMID: 38552911. (résumé scientifique structuré; texte intégral non fourni)
- He W, Zhang P, Hu Z, Yang S, Chen W, He T, Tang L, Zheng J, Li R, Xue B, Hu G, Zhang Y.. Enhanced-performance flexible pressure sensors enabled by synergistic effect of hierarchical porous structures for motion sensing and deep learning-assisted speech recognition.. Journal of colloid and interface science. 2025. DOI: 10.1016/j.jcis.2025.139706 · PMID: 41435647. (résumé scientifique structuré; texte intégral non fourni)
- MindClip IA : ce petit badge de Switchbot transforme vos conversations en rappels. 2026.




