Table of Contents
Introduction à la segmentation des tumeurs cérébrales
La segmentation précise des tumeurs cérébrales de l'imagerie médicale est essentielle pour le diagnostic, la planification du traitement et la surveillance de la progression de la maladie. L'imagerie par résonance magnétique (IRM) est la modalité préférée en raison de son contraste supérieur entre les tissus mous, fournissant de multiples séquences telles que les images pondérées T1, T2 et T1 pondérées T1 (T1ce). Chaque séquence met en évidence différents aspects de la pathologie tumorale : le noyau nécrotique, l'amélioration de la tumeur et l'œdème péritumoral.
La segmentation manuelle effectuée par des radiologistes ou des cliniciens est longue, subjective et sujette à la variabilité inter-observateurs. Le processus prend généralement de 30 minutes à plusieurs heures par patient cas, en fonction de la complexité tumorale. Ce goulot d'étranglement entrave les études cliniques à grande échelle et le déroulement efficace du travail dans les départements d'oncologie. Il y a donc un besoin pressant de méthodes de segmentation automatisées, fiables et rapides.
La segmentation automatisée des tumeurs cérébrales par l'apprentissage profond n'est pas seulement une curiosité de recherche; elle a des implications cliniques directes. Elle facilite la volumétrie quantitative des tumeurs pour l'évaluation de la réponse au traitement, aide à la planification chirurgicale en délimiteant les limites des tumeurs et soutient le contournage de la radiothérapie.
Approches d'apprentissage approfondi
Réseaux neuronaux convolutionnels (RCN)
Contrairement aux méthodes traditionnelles d'apprentissage automatique qui exigent l'ingénierie de fonctionnalités artisanales, les CNN apprennent automatiquement des représentations de fonctionnalités hiérarchiques à partir de données brutes sur les pixels. Pour la segmentation des tumeurs cérébrales, la tâche est généralement formulée comme un problème de classification par voie voxel : chaque pixel (ou voxel en 3D) reçoit une étiquette correspondant à différentes sous-régions tumorales (par exemple, tumeur entière, noyau tumoral, amélioration de la tumeur). L'introduction de réseaux entièrement convolutionnels (FCN) a permis l'apprentissage de bout en bout, où le réseau produit une carte de segmentation des mêmes dimensions spatiales que l'entrée.
Les premières approches basées sur le CNN utilisaient la classification par patch, mais elles étaient inefficaces sur le plan informatique et souffraient de la perte de contexte spatial. La percée est venue avec des architectures encoder-décoder qui combinent l'échantillonnage par downsampling (encodage) pour capturer des caractéristiques sémantiques de haut niveau et le rehaussement (décodage) pour récupérer la résolution spatiale.
U‐Net et ses variantes
L'architecture U-Net, introduite à l'origine pour la segmentation biomédicale de l'image, reste la base la plus largement adoptée pour les tâches de segmentation tumorale cérébrale. Sa conception symétrique encodeur-décodeur avec connexions saut permet d'apprendre efficacement les caractéristiques locales et mondiales. L'encodeur se compose de couches de convolution répétées suivies d'un pooling max, tandis que le décodeur utilise la convolution. Au fil des ans, de nombreuses extensions ont été proposées:
- Attention U‐Net: Incorpore des barrières d'attention qui se concentrent sur les régions pertinentes tout en supprimant des caractéristiques de fond non pertinentes.
- U‐Net résiduel: Utilise des blocs résiduels pour permettre l'entraînement de réseaux plus profonds sans gradients de disparition, améliorant les capacités d'extraction des fonctionnalités.
- nnU-Net (no-new-U-Net): Un cadre automatisé qui configure dynamiquement l'architecture réseau, le prétraitement et le posttraitement en fonction des caractéristiques de l'ensemble de données. Il a toujours obtenu le meilleur rang dans les défis de segmentation biomédicale, y compris le défi de segmentation des tumeurs cérébrales (BraTS).
Ces variantes U-Net ont été adaptées pour traiter les données volumétriques 3D en remplaçant les convolutions 2D par des convolutions 3D. Les U‐Nets 3D traitent des volumes entiers d'IRM, captant des corrélations inter-slices, qui sont essentielles pour une segmentation volumétrique précise.
V‐Net et DeepMedic
Alors que U‐Net est conçu pour les images 2D, V‐Net a été introduit spécifiquement pour la segmentation d'images médicales volumétriques. Il utilise un encodeur-décodeur 3D avec connexions résiduelles et utilise une fonction de perte de Die pour optimiser directement le chevauchement entre la segmentation prédite et la segmentation au sol. L'architecture V‐Net a été particulièrement réussie pour la segmentation de la prostate et du poumon, mais est également appliquée aux tumeurs cérébrales lorsque les contraintes de mémoire le permettent.
DeepMedic est une autre architecture influente qui se concentre sur l'analyse à plusieurs échelles. Elle se compose de deux voies de traitement parallèles : l'une qui traite l'image en pleine résolution et l'autre qui traite une version sous-échantillonnée pour capturer un contexte plus large. Les sorties sont combinées pour produire la segmentation finale. DeepMedic équilibre efficacement les détails locaux et le contexte global sans avoir besoin de réseaux très profonds, ce qui le rend efficace par calcul.
Fonctions de perte et critères d'évaluation
Pour la segmentation tumorale du cerveau, où les régions tumorales sont souvent petites par rapport à des tissus cérébraux sains (déséquilibre de classe), la perte standard de l'entropie peut conduire à des prédictions biaisées vers le fond.
- Perte de dés: D'après le coefficient de similitude des dés (DSC), il mesure le chevauchement entre la prédiction et la vérité au sol. Il est invariant par rapport à la taille absolue des régions, atténuant le déséquilibre de classe.
- Perte généralisée de dés :[ Une extension qui attribue des poids de classe pour gérer des déséquilibres multi-classes, comme les différentes sous-régions tumorales.
- Perte focale:[ Ajoute un facteur de modulation à la perte cross-entropie qui abaisse les exemples faciles et concentre l'apprentissage sur des exemples difficiles et mal classés.
- Pertes budgétaires :[ Perte fondée sur la distance qui pénalise les erreurs de limite, améliorant la précision du contour.
Les mesures d'évaluation comprennent généralement le score de Die pour le chevauchement, la distance de Hausdorff pour l'accord de frontière, la précision, le rappel, et la spécificité. Le défi BraTS utilise le score de Die pour la tumeur entière, le noyau de tumeur, et l'amélioration de la tumeur, ainsi que la distance de Hausdorff au 95e centile.
Les défis du développement modèle
Données annotées limitées et inégales
L'un des obstacles les plus importants est la rareté de grands ensembles de données annotées de haute qualité. L'annotation des tumeurs cérébrales dans les volumes d'IRM 3D est une activité intensive et nécessite des neuro-radiologues experts. L'ensemble de données BraTS, qui comprend des analyses IRM préopératoires multi-institutionnelles, est la norme de facto pour l'analyse comparative, mais il ne comprend que quelques milliers de cas.
Dans une tranche typique de l'IRM, les pixels tumoraux constituent une petite fraction (souvent moins de 10% de la surface du cerveau). Les sous-régions comme la tumeur en augmentation sont encore plus petites. Les modèles formés avec des fonctions de perte standard ont tendance à ignorer les classes minoritaires, conduisant à une segmentation médiocre de ces sous-régions cliniquement importantes.
Variabilité de l'apparence des tumeurs
Les tumeurs cérébrales varient grandement en taille, forme, emplacement, intensité et patrons d'amélioration du contraste. Le glioblastome présente souvent des formes irrégulières, des carottes nécrotiques et un oedème environnant. Les gliomes de faible grade peuvent être plus diffus et moins bien définis. Les tumeurs métastatiques peuvent être multiples et petites. Cette hétérogénéité rend difficile pour un modèle unique de généraliser tous les types de tumeurs et grades.
Changement de domaine dans les protocoles d'imagerie
Les paramètres d'acquisition de l'IRM (p. ex., force du champ, paramètres de séquence, fabricant) introduisent la variabilité de l'apparence de l'image. Un modèle formé sur des données d'un scanner ou d'une institution se comporte souvent mal sur des données d'un autre, un phénomène appelé déplacement de domaine.
Contraintes informatiques et de mémoire
Un U‐Net 3D typique peut avoir plus de 50 millions de paramètres et nécessiter des GPU haut de gamme avec 16 à 32 Go de mémoire, limitant l'accessibilité pour les groupes de recherche plus petits ou le déploiement clinique sur matériel standard. La compression des modèles, la taille, la quantisation et la distillation des connaissances sont explorées pour réduire l'empreinte de mémoire et le temps d'inférence sans sacrifier la précision.
Qualité de l'annotation et variabilité inter-observateurs
Même parmi les experts, il y a une variabilité modérée à substantielle dans la segmentation des sous-régions tumorales cérébrales, en particulier pour les limites de l'œdème et du noyau tumoral. Cette ambiguïté dans la vérité de base crée une limite supérieure sur les performances réalisables.
Progrès récents et orientations futures
Apprentissage auto-supervisé et semi-supervisé
Pour atténuer la dépendance à l'égard des grands ensembles de données annotés, les méthodes d'apprentissage auto-supervisé (SSL) ont acquis une traction. Les modèles de pré-formation SSL sur les données non marquées en utilisant des tâches de prétexte qui forcent le réseau à apprendre des représentations significatives. Pour l'IRM cérébrale, les tâches de prétexte comme l'apprentissage contrasté, la modélisation d'images masquées ou la reconstruction de modalités manquantes se sont avérés efficaces.
Transformateurs de vision (ViTs) et modèles hybrides
Les modèles comme UNETR (UNET TRansformers) utilisent un Transformer comme encodeur pour saisir les dépendances à longue distance et le contexte global, que les CNN peuvent manquer en raison de champs réceptifs limités. Swin UNETR, une variante basée sur le Transformer Swin avec fenêtres décalées, obtient des résultats de pointe sur la référence BraTS 2021. Les architectures hybrides combinant CNN et Transformer ont pour but de tirer parti des forces des deux : l'extraction locale de fonctionnalités des CNN et le contexte global des Transformers. Ces modèles nécessitent souvent plus de données et de ressources informatiques mais peuvent surpasser les CNN purs.
Modèles de diffusion pour l'augmentation des données
En générant des IRM réalistes avec des formes et des emplacements de tumeurs contrôlés, ces modèles traitent de la rareté des données et du déséquilibre de classe. Les images synthétiques peuvent être jumelées à des segmentations générées automatiquement ou utilisées de manière auto-supervisée. Les résultats préliminaires indiquent que la formation sur les ensembles de données augmentées améliore la segmentation des scores de dés de 1 à 3 % sur l'ensemble de tests BraTS. Cependant, s'assurer que les données générées représentent fidèlement la réalité clinique sans introduire d'artefacts demeure un défi ouvert.
Intégration multi-modale et multi-tâche
Les modèles de segmentation tumorale cérébrale utilisent généralement quatre séquences d'IRM (T1, T1ce, T2, FLAIR) comme canaux d'entrée. Les travaux récents explorent des modalités supplémentaires, comme l'imagerie par tenseur de diffusion (DTI), l'imagerie pondérée par perfusion (PWI) ou la spectroscopie MR, pour fournir des informations complémentaires sur l'infiltration tumorale et la vascularité.
Explicabilité et estimation de l'incertitude
Pour l'acceptation clinique, les modèles doivent être transparents et transmettre la confiance dans leurs prédictions. Les techniques d'explication, comme les cartes de saliabilité, le Grad-CAM et l'attribution de concepts, mettent en évidence les régions de l'entrée qui ont influencé la décision du modèle. L'estimation d'incertitude, en utilisant les méthodes de décrochage ou d'ensemble Monte Carlo, quantifie la fiabilité de chaque voxel prédit.
Segmentation en temps réel et déploiement des bords
Les modèles actuels d'apprentissage profond nécessitent généralement plusieurs secondes à minutes pour segmenter un volume 3D sur un GPU. Pour une utilisation intraopératoire ou un rapport immédiat, une inférence plus rapide est nécessaire. Des techniques telles que la quantification des modèles (en utilisant la demi-précision FP16 ou INT8), la taille du réseau et la conception d'architecture efficace (p. ex., les encodeurs MobileNetV3) permettent une segmentation en temps quasi réel sur les CPU ou les appareils mobiles.
fédéré apprentissage pour la collaboration en matière de protection de la vie privée
L'apprentissage fédéré permet à plusieurs institutions de former en collaboration un modèle sans partager de données sur les patients; seules des mises à jour de modèles sont échangées. Plusieurs initiatives à grande échelle, dont le défi de la segmentation des tumeurs fédérées (FeTS), ont démontré que les modèles fédérés peuvent obtenir des performances comparables à celles des modèles formés au niveau central tout en préservant la confidentialité des données.
Traduction réglementaire et clinique
Malgré de nombreux documents de recherche, seule une poignée d'outils automatisés de segmentation ont reçu l'approbation réglementaire (marque FDA ou CE).La traduction de la recherche en pratique clinique nécessite une validation rigoureuse sur des ensembles de données multicentriques de grande envergure, l'intégration aux systèmes informatiques hospitaliers (PACS, DICOM) et la démonstration de l'utilité clinique.
Conclusion
Les modèles d'apprentissage approfondi ont fondamentalement progressé dans le domaine de la segmentation automatisée des tumeurs cérébrales, atteignant des performances rivalisant avec les experts humains sur les ensembles de données de référence. L'évolution des NNC simples vers des architectures sophistiquées comme U‐Net, V‐Net et Vision Transformers a amélioré la précision et la robustesse.
L'avenir de la segmentation automatisée des tumeurs cérébrales réside dans une intégration transparente dans les flux de travail cliniques, l'inférence en temps réel et les résultats interprétables qui favorisent la confiance entre les cliniciens. Comme les modèles deviennent plus capables de gérer la variabilité inhérente des tumeurs cérébrales, ils permettront des soins neuro-oncologiques plus personnalisés et précis. La collaboration continue entre les équipes de recherche, les centres cliniques et les organismes de réglementation est essentielle pour traduire ces percées technologiques en pratique courante.