소개: 왜 Data Management Matters in Engineering Research

이 연구는 센서 읽기 및 시뮬레이션 출력에서 실험 측정 및 디자인 파일에 대한 광범위한 데이터의 양을 생산합니다. 이 귀중한 리소스는 파편, 손실 또는 무해한 파편이 될 수 없습니다. Effective data management and sharing] are notoptional; 그들은 재현성, 신뢰성 및 충격 공학 과학에 대한 기초입니다. 이 문서는 연구 및 연구에 대한 모범 사례를 설명하고 연구에 대한 연구, 연구 및 개발 및 연구에 대한 모범 사례를 설명합니다.

이 연구는 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발, 연구 및 개발 및 개발, 연구 및 개발 및 개발, 연구 및 개발 및 개발, 연구 및 개발 및 개발 및 개발, 연구 및 개발 및 개발 및 개발, 연구 및 개발 및 개발 및 개발, 연구 및 개발 및 개발 및 개발 및 개발 및 개발 및 개발 및 개발 및 개발.

Data Management의 중요성

엔지니어링 연구는 종종 물리적 실험 또는 계산 모델에서 생성 된 대형 복잡한 데이터 세트가 포함되어 있습니다. 구조적 접근 방식없이 데이터는 신속하게 낭비되고, 시간이 지남에 따라 오류 및 불확실한 발견을 선도 할 수 있습니다. [FLT : 0]]Proper data management는 투명성과 무결성을 향상시킵니다 [FLT : 1] 모든 관찰, 매개 변수 및 처리 단계가 추적 할 수 있도록합니다. 또한 기금 모금과 같은 [LT : 2] [FLT : 3F]] [FLT : 3F]]] [FLT : 3F]]] : 3F : 3F : 3F : 3F : 3F : 3F : 4F : 3F : 3F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4F : 4

이 웹 사이트는 귀하가 웹 사이트를 탐색하는 동안 귀하의 경험을 향상시키기 위해 쿠키를 사용합니다. 이 쿠키들 중에서 필요에 따라 분류 된 쿠키는 웹 사이트의 기본적인 기능을 수행하는 데 필수적이므로 브라우저에 저장됩니다. 또한이 웹 사이트의 사용 방식을 분석하고 이해하는 데 도움이되는 제 3 자 쿠키를 사용합니다. 이 쿠키는 귀하의 동의하에 만 브라우저에 저장됩니다. 이러한 쿠키를 거부 할 수도 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다.

Data Management에 대한 모범 사례

연구 그룹에 걸쳐 일관된 데이터 관리 관행의 집합을 실행하면 효율성과 신뢰성을 극적으로 향상시킬 수 있습니다. 아래는 주요 구성 요소입니다.

Data 정리

논리 폴더 구조와 일관된 naming 컨벤션을 채택 한다. 예를 들어, 프로젝트의 최상위 폴더를 사용 하 여 실험 또는 시뮬레이션, 그리고 원료 데이터에 대 한 하위 하위 하위 하위 하위 하위 폴더, 처리 된 데이터 및 분석 스크립트. 파일 이름은 프로젝트, 날짜 및 버전 정보 (예를 들어, ])를 포함 해야 합니다. 이것은 누구 든 지 쉽게 만들 수 있습니다-당신의 미래 자기-동의 수백 디렉터리를 파기 없이 특정 파일을 찾을 수.

각 폴더의 README 파일을 사용하여 내용, 데이터셋의 변수, 그리고 사용된 약어 또는 코드에 대해 설명합니다. 또한 구조화된 README는 데이터시트, 저장 시간 및 미묘한 이해를 줄여줍니다.

문서 데이터 Thoroughly

문서는 폴더 조직을 넘어 간다. 설명하는 종합적인 메타데이터를 작성:

  • 측정 또는 시뮬레이션 된 것
  • 데이터 수집 방법 (확장 설정, 소프트웨어 버전, 교정 세부 사항)
  • 일정 및 시간
  • 단위 및 정밀도
  • 적용된 모든 처리 단계
  • 파일 간의 관계

전자 실험실 노트북 (ELNs) 또는 전용 메타 데이터 표준 (예 : [[FLT : 0]]] FAIR 원리[[FLT : 1]])이 프로세스를 단순화 할 수 있습니다. 목표는 동사적 설명없이 데이터 해석을하기 위해 귀하의 필드에 통보 된 조사가 이해하고 재사용 할 수 있도록합니다.

Data Quality에 대한 정보

여러분의 데이터는 정확성, 완전성, 일관성을 보장하는 것입니다. 자동화된 스크립트는 아웃리에, 누락된 값, 또는 인소싱을 확인할 수 있습니다. 알려진 표준 또는 복제 측정에 대한 크로스 체크를 수행하여 정밀성을 확인합니다. 문서는 어떤 영향을 미칩니다. 고품질 데이터는 결함이 있는 결론을 감소시키고 출판물의 신뢰성을 강화합니다.

모든 데이터셋이 분석에 사용되기 전에 통과해야 하는 품질 보증 검사리스트를 구현하는 것을 고려하십시오. 이것은 구조상 또는 항공 우주 공학과 같은 안전 크리티컬 분야에서 특히 중요합니다.

버전 제어 구현

Git(Code and small files) 또는 DVC와 같은 데이터 버전 제어 시스템을 사용하여 데이터셋 및 분석 스크립트에 대한 변경 사항. 이 수정의 전체 역사를 유지하고, 이전 상태로 롤백을 허용하고, 여러 연구원들 사이에서 협력을 지원합니다. 각 버전은 날짜와 변경 사항 설명과 함께 태그되어야 합니다.

Git에 잘 적응되지 않은 큰 바이너리 데이터 세트를 위해, 버전 (예를들면, Dataverse, Zenodo) 또는 Git 저장소에서 체크섬을 저장하는 데이터 관리 플랫폼을 사용하여 무결성을 확인합니다.

백업 데이터 보안

데이터 손실은 catastrophic 일 수 있습니다. 데이터의 적어도 3 사본을 유지하십시오: 1개의 1개의 국소 백업 (예를들면, 외부 하드 드라이브) 및 1개의 off-site 백업 (예를들면, 구름 저장 또는 기관 서버). 일관성을 지키기 위하여 자동화한 백업 공구를 사용하십시오. unauthorized 접근에 대하여 보호하는 과민한 자료를 암호로 고쳐 만드십시오.

일반적으로 백업 복원 프로세스를 테스트합니다. 백업은 실제로 필요한 경우 데이터를 복구 할 수 있다면 유용합니다.

엔지니어링 출판물의 데이터 공유

데이터가 내부적으로 관리되면 다음 단계는 더 넓은 커뮤니티와 공유됩니다. 효과적인 공유는 개인 정보 보호 및 윤리를 존중하고 명확한 라이선스 및 인용 정보를 제공합니다.

오른쪽 저장소 선택

저장소를 선택합니다:

  • Trusted and persistent: 은 지속 식별자(DOIs)를 할당하는 저장소를 사용합니다. 예에는 Zenodo, 기관 저장소 및 DataHub Engineering collection와 같은 분야별 데이터베이스가 있습니다.
  • 데이터 유형에 적합: 저장소는 파일 형식과 데이터 크기를 지원한다. 일부 저장소는 대형 엔지니어링 데이터 세트(예:, 시뮬레이션 출력, 포인트 클라우드)를 전문으로 한다.
  • 검색엔진에 의해인덱싱:Google Dataset Search 또는 이와 유사한 도구로 인덱스되는 저장소는 데이터의 검색성을 증가시킵니다.

저널 요구 사항 확인-매니 엔지니어링 저널 선호 저장소 지정 또는 해당 데이터 가용성 정책에 충족.

데이터 프라이버시 및 윤리

이 웹 사이트는 귀하가 웹 사이트를 탐색하는 동안 귀하의 경험을 향상시키기 위해 쿠키를 사용합니다. 이 쿠키들 중에서 필요에 따라 분류 된 쿠키는 웹 사이트의 기본적인 기능을 수행하는 데 필수적이므로 브라우저에 저장됩니다. 또한이 웹 사이트의 사용 방식을 분석하고 이해하는 데 도움이되는 제 3 자 쿠키를 사용합니다. 이 쿠키는 귀하의 동의하에 만 브라우저에 저장됩니다. 이러한 쿠키를 거부 할 수도 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다.

허용된 사용을 지정할 수 있는 데이터 사용 계약 또는 라이센스를 사용합니다. Creative Commons licenses] (CC0, CC BY 4.0)는 오픈 데이터에 사용됩니다. 귀하의 목표 공유와 일치하는 것을 선택하십시오.

데이터 라이센스 및 인용

CC0 (public domain dedication)은 법적 구의를 피하기 위해 데이터에 대한 명확한 라이센스를 적용하여 재사용을 극대화합니다. CC BY 4.0은 타당성을 필요로합니다. 데이터가 다른 소스에서 파생되면 라이센스를 준수해야합니다. 저자, 제목, 저장소, DOI 및 날짜를 포함한 데이터 세트 메타 데이터에서 권장 인용 형식을 제공합니다. 이 다른 사람들이 제대로 작업 크레딧을받습니다.

많은 저장소는 자동으로 인용 텍스트를 생성합니다; 정확도에 대한 리뷰를 읽으십시오.

Data Availability Statement를 작성하십시오.

대부분의 엔지니어링 저널은 이제 원고의 데이터 가용성 진술을 요구합니다. 명시되어야합니다. "이 연구의 발견을 지원하는 데이터는 [Repository Name]에서 [DOI], 참조 번호 [X]에서 공개적으로 사용할 수 있습니다. 일부 데이터가 공유될 수 없는 경우, 설명합니다. (예 : 독점적 인 제약) 및 접근 조건을 설명합니다.

Data Management의 도전과 솔루션

이러한 관행은 도전없이는 아닙니다. 일반적인 장애물은 다음과 같습니다.

  • 시간과 훈련의 부족: 데이터 관리의 위치를 알 수 있습니다. 연구 프로세스의 핵심 부분으로 치료하십시오. 많은 기관은 워크샵이나 온라인 모듈을 제공합니다.
  • Heterogeneous data types:] 다른 데이터 형식을 수용할 수있는 유연한 디렉토리 구조와 메타 데이터 스키마를 사용합니다. ]FAIRplus] 같은 도구는 지도를 제공합니다.
  • 대형 파일 크기: 가능한 파일 압축, 또는 다른 저장소 및 처리 된 데이터에 대한 원료 저장. 일부 저장소는 큰 파일 (예를 들어, 데이터셋 당 최대 50 GB)를 허용한다.
  • ]스크루에 대한 조건: 당신은 기간에 대한 데이터를 embargo 할 수 있습니다 (12 개월) 초록에 대한 시간을 허용, 여전히 메타 데이터 기록으로 입금하는 동안.

이러한 도전의 많은 것은 연습과 기관의 데이터 관리 사무실 또는 도서관의 지원으로 더 쉽게 될 수 있다는 것을 기억하십시오.

미래 지향: FAIR 및 Open Science

엔지니어링 커뮤니티는 FAIR 원칙(Findable, Accessible, Interoperable, Reusable)을 좋은 데이터 관리에 대한 벤치 마크로 이동하고 있습니다. 실제로, 다음과 같은 의미를 가지고 있습니다.

  • Findable: Assign persistent 식별자(DOIs) 및 풍부한 메타데이터.
  • Accessible: 은 접근이 제한되는 경우에도 표준 프로토콜(HTTP, FTP)을 통해 데이터가 검색될 수 있습니다.
  • Interoperable: 오픈, 커뮤니티표준 파일 형식(예: HDF5, CSV, NetCDF) 및 제어 어휘를 사용합니다.
  • Reusable: 명확한 라이선스, 검증 문서 및 도메인 별 메타데이터를 제공합니다.

FAIR 관행을 채택하면 과학적 커뮤니티를 얻을뿐만 아니라 자신의 워크플로우를 향상시키고, 이전 데이터를 다시 연결하고 팀 전반에 걸쳐 협업하고, 게시자 요구 사항을 만족시킵니다.

관련 기사

데이터 관리 및 공유의 모범 사례를 구현하는 것은 연구 경력 전반에 걸쳐 배당되는 투자입니다. 데이터를 명확하게 구성함으로써, 버전 컨트롤을 사용하여 품질을 보장하고, 안전하게 백업하고, 작업과 가치를 높이는 것입니다. 명확한 라이센스와 인용을 가진 신뢰할 수있는 저장소에 데이터를 공유하고, 협업을 촉진하고 공학 과학에 신뢰를 구축합니다. 펀더, 저널, 기관은 이러한 혁신을 강조하고, 혁신을 주도하고, 혁신을 주도하고, 사회를 주도하고, 사회를 주도하고, 사회를 존중하고, 사회를 존중하며, 사회를 존중하며, 사회를 존중하며, 사회를 존중하며, 사회를 존중합니다.