Introduction : Pourquoi la gestion des données compte dans la recherche en génie

La recherche en génie produit de grandes quantités de données, des lectures de capteurs et des sorties de simulation aux mesures expérimentales et aux fichiers de conception. Pourtant, sans gestion délibérée, cette ressource précieuse peut devenir fragmentée, perdue ou inutilisable. La gestion et le partage efficaces des données ne sont pas facultatifs; ils sont fondamentaux pour reproductibles, crédibles et percutantes en sciences de l'ingénierie.

Les bonnes pratiques en matière de données permettent de vérifier les résultats, de soutenir les méta-analyses, de alimenter les ensembles de formation en apprentissage automatique et d'accélérer l'innovation en permettant à d'autres de tirer parti des travaux existants.

L'importance de la gestion des données en ingénierie

Sans approche structurée, les données peuvent rapidement être désorganisées, ce qui entraîne un gaspillage de temps, d'erreurs et de résultats irréproductibles. La gestion des données par les promoteurs améliore la transparence et l'intégrité en veillant à ce que chaque étape d'observation, de paramètre et de traitement soit traçable. Elle facilite également la conformité aux mandats des bailleurs de fonds tels que la politique de partage des données et les exigences de la revue comme celles de Portfolio nature.

Au-delà de la conformité, les données bien gérées sont un catalyseur de découverte. D'autres chercheurs peuvent reproduire vos analyses, tester des hypothèses alternatives ou combiner vos données avec les leurs pour atteindre de nouvelles perspectives.

Meilleures pratiques de gestion des données

La mise en oeuvre d'un ensemble de pratiques de gestion des données uniformes dans votre groupe de recherche peut améliorer considérablement l'efficacité et la fiabilité.

Organiser les données de façon claire

Par exemple, utilisez un dossier de haut niveau pour le projet, des sous-dossiers pour les expériences ou les simulations, et des sous-dossiers pour les données brutes, les données traitées et les scripts d'analyse. Les noms de fichiers doivent inclure les informations sur le projet, la date et la version (p. ex. ). Cela facilite la recherche de fichiers spécifiques sans creuser des centaines de répertoires pour quiconque, y compris votre futur auto-identification.

Utilisez des fichiers README dans chaque dossier pour expliquer le contenu, les variables des ensembles de données et toutes abréviations ou codes utilisés. Un README bien structuré agit comme une feuille de données, économisant du temps et réduisant les malentendus.

Documenter les données de façon approfondie

La documentation va au-delà de l'organisation des dossiers.

  • Ce qui a été mesuré ou simulé
  • Comment les données ont été collectées (paramètres des instruments, versions logicielles, détails d'étalonnage)
  • Date et heure de la collecte
  • Unités et précision
  • Toutes les étapes de traitement appliquées
  • Relations entre les fichiers

Des outils comme les carnets électroniques de laboratoire (ELN) ou les normes de métadonnées spécifiques (p. ex. Les principes FAIR) peuvent simplifier ce processus.L'objectif est de rendre vos données interprétables sans avoir besoin d'explications verbales, afin qu'un chercheur informé dans votre domaine puisse les comprendre et les réutiliser.

Assurer la qualité des données

Validez régulièrement vos données pour en vérifier l'exactitude, l'exhaustivité et la cohérence. Les scripts automatisés peuvent vérifier les valeurs aberrantes, les valeurs manquantes ou les incohérences de format. Effectuez des vérifications croisées par rapport aux normes connues ou répétez des mesures pour confirmer la précision.

Envisager de mettre en place une liste de contrôle de l'assurance de la qualité que tous les ensembles de données doivent passer avant d'être utilisés pour l'analyse, ce qui est particulièrement important dans les domaines critiques pour la sécurité, comme le génie structural ou aérospatial.

Mettre en œuvre le contrôle de version

Suivre les modifications apportées aux ensembles de données et aux scripts d'analyse en utilisant des systèmes de contrôle de version tels que Git (pour les fichiers de code et les petits fichiers) ou des outils de version de données comme DVC. Ceci maintient un historique complet des modifications, permet de revenir aux états précédents et supporte la collaboration entre plusieurs chercheurs.

Pour les grands ensembles de données binaires qui ne sont pas bien adaptés à Git, envisager d'utiliser des plateformes de gestion de données qui supportent la version (p. ex. Dataverse, Zenodo) ou des comptes de contrôle de stockage dans un dépôt Git pour vérifier l'intégrité.

Données de sauvegarde en toute sécurité

La perte de données peut être catastrophique.Tenir au moins trois copies de vos données : une sauvegarde primaire, une sauvegarde locale (p. ex. disque dur externe) et une sauvegarde hors site (p. ex. stockage en nuage ou serveur institutionnel).Utilisez des outils de sauvegarde automatisés pour assurer la cohérence.

Testez régulièrement votre processus de restauration de sauvegarde. Une sauvegarde n'est utile que si vous pouvez effectivement récupérer les données lorsque nécessaire.

Partage de données dans les publications d'ingénierie

Une fois que vous avez géré vos données à l'interne, la prochaine étape consiste à les partager avec la communauté en général. Le partage efficace consiste à choisir le bon dépôt, à respecter la vie privée et l'éthique et à fournir des renseignements clairs sur les licences et les citations.

Choisir le bon dépôt

Sélectionnez un dépôt qui est :

  • Trusté et persistant:[ Utiliser des dépôts bien établis qui attribuent des identifiants persistants (DI). Exemples : Zénodo, des dépôts institutionnels et des bases de données spécifiques à la discipline comme la collection DataHub .
  • Compatible avec vos types de données:[ Assurez-vous que le dépôt supporte les formats de fichiers et les tailles de données dont vous avez besoin. Certains dépôts se spécialisent dans les grands ensembles de données d'ingénierie (p. ex. sortie de simulation, nuages de points).
  • Indice par les moteurs de recherche: Les dépôts indexés par Google Dataset Search ou des outils similaires augmentent la découverte de vos données.

Vérifiez les exigences des revues — de nombreuses revues d'ingénierie précisent un dépôt préféré ou acceptent toute autre publication conforme à leur politique de disponibilité des données.

Confidentialité et éthique des données

Avant de partager, assurez-vous d'avoir le droit de le faire. Obtenir des autorisations, anonymiser les données personnelles (p. ex. supprimer les noms, utiliser des statistiques agrégées) et effacer les secrets commerciaux ou les informations contrôlées par l'exportation. Si le partage intégral est impossible, envisager de fournir un sous-ensemble anonymisé ou un ensemble de données synthétiques qui conserve les principales propriétés statistiques.

Utilisez des accords ou licences d'utilisation de données pour spécifier les utilisations autorisées.Les licences Creative Commons (CC0, CC BY 4.0) sont populaires pour les données ouvertes; choisissez celle qui s'harmonise avec vos objectifs de partage.

Licences de données et citation

Le CC0 (dédicace de domaine public) maximise la réutilisation, tandis que le CC BY 4.0 exige l'attribution. Si vos données proviennent d'autres sources, assurez-vous de respecter leurs licences. Fournissez un format de citation recommandé dans vos métadonnées de ensembles de données, y compris les auteurs, le titre, le dépôt, la DOI et la date.

De nombreux dépôts génèrent automatiquement du texte de citation, puis le examinent pour en vérifier l'exactitude.

Écrire une déclaration de disponibilité des données

La plupart des revues d'ingénierie exigent maintenant un relevé de disponibilité des données dans votre manuscrit. Soyez explicite : - Les données qui appuient les résultats de cette étude sont ouvertement disponibles dans [Nom du dépôt] à [DOI], numéro de référence [X].- Si certaines données ne peuvent être partagées, expliquez pourquoi (p. ex., contraintes propriétaires) et décrivez les conditions d'accès.

Défis et solutions en matière de gestion des données

La mise en œuvre de ces pratiques n'est pas sans difficultés, notamment les obstacles suivants :

  • L'offre de temps et de formation:[ Allouez du temps pour la gestion des données dès le départ; traitez-le comme une partie essentielle de votre processus de recherche.
  • Types de données hétérogènes:[ Utilisez une structure de répertoire souple et un schéma de métadonnées qui peuvent accueillir différents formats de données. Des outils comme FAIRplus fournissent des conseils.
  • Tailles de fichiers plus grandes: Compresser les fichiers lorsque c'est possible, ou stocker des données brutes dans un dépôt et traiter des données dans un autre. Certains dépôts acceptent des fichiers volumineux (par exemple, Zenodo jusqu'à 50 Go par jeu de données).
  • Concernant sur le scooping:[ Vous pouvez embargoer les données pendant une période (souvent 12 mois) pour laisser du temps aux publications primaires, tout en les déposant avec un enregistrement de métadonnées.

Rappelez-vous que bon nombre de ces défis deviennent plus faciles avec la pratique et avec le soutien du bureau de gestion des données ou de la bibliothèque de votre institution.

Orientations futures : FAIR et science ouverte

La communauté des ingénieurs s'oriente vers les principes FAIR (Findable, Accessible, Interoperable, Reusable) comme référence pour une bonne gestion des données.

  • Retrouvé: Assigner des identifiants persistants (DOI) et des métadonnées riches.
  • Accessible:[ Assurez-vous que les données peuvent être récupérées via des protocoles standard (HTTP, FTP) même si l'accès est restreint.
  • Interopérable:[ Utiliser des formats de fichiers ouverts et normalisés par la communauté (p. ex. HDF5, CSV, NetCDF) et des vocabulaires contrôlés.
  • Reutilisable:[ Fournir des licences claires, de la documentation de provenance et des métadonnées spécifiques à un domaine.

L'adoption de pratiques FAIR profite non seulement à la communauté scientifique, mais améliore également votre propre workflow, ce qui facilite la révision des données anciennes, la collaboration entre les équipes et la satisfaction des exigences des éditeurs.

Conclusion

En organisant clairement les données, en les documentant de façon approfondie, en assurant la qualité, en utilisant le contrôle des versions et en les soutenant de façon sécuritaire, vous protégez votre travail et augmentez sa valeur. Le partage de données dans des dépôts de confiance avec des licences et des citations claires étend l'impact de vos recherches, favorise la collaboration et renforce la confiance en sciences du génie.