导言:为什么在工程研究中数据管理事项

工程研究产生大量数据,从传感器读数和模拟输出到实验测量和设计文件。然而,如果不进行审慎的管理,这种宝贵的资源就可能变得支离破碎、丢失或无法使用。 有效的数据管理和共享[不是可选的;它们是复制可复制、可信和有影响的工程科学的基础。 本条概述了在工程出版物中管理和分享研究数据的最佳做法,为研究人员提供每个职业阶段的可操作的指导。

良好的数据实践可以核查结果,支持元分析,燃料机器学习培训,并通过让其他人在现有工作的基础上加快创新。 这些数据实践还符合供资机构、机构政策和许多学术期刊的要求,它们现在要求数据提供说明。 通过采用这些实践,工程研究人员为更加透明和合作的科学生态系统做出了贡献。

数据管理在工程中的重要性

工程研究往往涉及物理实验或计算模型产生的大型复杂数据集。如果没有结构化的方法,数据可能很快变得无序,导致时间浪费、错误和无法产生的结果。 Proper数据管理通过确保每个观测、参数和处理步骤都能够追踪,从而提高透明度和完整性[。它还有助于遵守供资者的任务,如[NSF数据共享政策[和诸如自然组合的日记要求。

除了遵守外,管理良好的数据是发现的催化剂。 其他研究人员可以复制你的分析,测试替代假设,或者将你的数据与自己的数据结合起来,以达到新的见解。 在机械工程、土木工程和电气工程等领域,共享数据集加快了从材料设计到能源系统优化等领域的进展。

数据管理最佳做法

在整个研究小组中实施一套一致的数据管理做法,可大大提高效率和可靠性。

明显组织数据

采用逻辑文件夹结构和一致的命名惯例。 例如, 使用项目顶级文件夹、 实验或模拟子文件夹、 以及原始数据、 处理的数据和分析脚本子文件夹。 文件名应包括项目、 日期和版本信息( 如 [[FLT: 0] ) 。 这样, 任何人都可以很容易地找到特定文件, 包括未来的自我, 而不挖掘数百个目录 。

使用每个文件夹中的 README 文件来解释内容,数据集中的变量,以及所使用的任何缩写或代码. 结构良好的 README 起到数据表的作用,节省时间和减少误解.

文档数据

文件超出了文件夹组织范围。创建全面的元数据,描述:

  • 测量或模拟的
  • 数据收集方式(仪器设置、软件版本、校准细节)
  • 收集日期和时间
  • 单位和精确度
  • 应用的任何处理步骤
  • 文件之间的关系

电子实验室笔记本(ELN)或专用元数据标准(例如]FAIR原理[])等工具可以简化这一过程,目的是使您的数据可以解释而无需口头解释——这样,您领域的知情研究人员就可以理解并重用它。

确保数据质量

定期验证您的数据的准确性、完整性和一致性。 自动脚本可以检查外部值、 缺失值或格式不一致。 对照已知标准进行交叉检查或复制测量以确认精确性。 记录任何异常及其解决方式。 高质量的数据可以降低结论有缺陷的风险, 并加强您出版物的可信度 。

考虑实施质量保证清单,所有数据集在用于分析之前都必须通过,这一点在结构或航空航天工程等安全关键领域尤其重要。

执行版本控制

使用 Git (代码和小文件) 等版本控制系统或DVC 等数据版本工具跟踪数据集和分析脚本的修改。这保持了完整的修改历史,允许回滚到以前的状态,并支持多个研究人员之间的协作。每个版本都应该加贴日期和更改描述。

对于不适合Git的大二进制数据集,考虑使用支持版本化(如Dataverse,Zenodo)或存储在Git寄存器中的校验和的数据管理平台来验证完整性.

安全备份数据

数据丢失可能是灾难性的。 保存您数据的至少三份副本: 一份主备份, 一份本地备份( 如外部硬盘), 一份外部备份( 如云存储或机构服务器) 。 使用自动备份工具确保一致性 。 加密敏感数据, 防止未经授权的访问 。

定期测试备份恢复进程。 只有在需要时能够实际恢复数据时, 备份才有用 。

工程出版物数据共享

一旦你内部管理了数据,下一步就是与更广泛的社区分享数据。 有效的分享包括选择正确的存储处,尊重隐私和道德,并提供明确的许可和引用信息。

选择右侧仓库

选择一个寄存器,即 :

  • 可信和持久性:[ 使用已建立完善的可指定持久性识别符的存储器,例如Zenodo、机构存储器和诸如DataHub工程集等学科数据库。
  • 与您的数据类型兼容:[ 确保寄存器支持您需要的文件格式和数据大小. 一些寄存器专门处理大型工程数据集(如模拟输出,点云).
  • 被搜索引擎所插入:]通过Google数据集搜索或类似工具索引的存储器可以提高你的数据的可发现性.

检查日记账要求——许多工程日记账指定了首选的存储库或接受符合其数据提供政策的任何信息。

数据隐私和道德

工程研究有时涉及行业伙伴、人类主体(如用户试验)或敏感基础设施的机密或专有数据。在共享之前,确保您有权这样做。获取许可、匿名个人数据(如删除姓名、使用汇总统计数据)以及编辑商业秘密或出口控制信息。如果无法完全共享,请考虑提供匿名子集或合成数据集,保留关键统计属性。

使用数据使用协议或许可证来指定允许的用途。创建普通许可证[(CC0,CC BY 4.0)对于开放数据很受欢迎;选择与您共享目标一致的许可。

数据许可证和引用

使用明确的许可来避免法律上的模糊性 。 CC0( 公有领域专注) 将重复使用最大化, 而 CC BY 4. 0 则需要归属。 如果您的数据来自其他来源, 请确保您遵守许可。 在您的数据集元数据中提供推荐引用格式, 包括作者、 标题、 寄存器、 DOI 和日期。 这鼓励其他人正确信用您的工作 。

许多寄存器自动生成引用文本;检查其准确性.

写入数据可用性语句

大多数工程期刊现在都要求在您的手稿中提供数据。请明确:“支持本研究结论的数据在[DOI]的[仓库名称]中公开提供。” 如果无法共享一些数据,请解释原因(例如专利限制)并描述任何访问条件。

数据管理方面的挑战和解决办法

实施这些做法并非没有挑战,常见障碍包括:

记住,随着实践的开展,以及在贵机构数据管理办公室或图书馆的支持下,这些挑战中的许多变得更容易。

未来方向:公平与开放科学

工程界正在朝着公平、公正、平等原则(可找到、可访问、互操作、可再利用)迈进,以此作为良好数据管理的基准。

  • 查找: 指定持久性标识符(DOI)和丰富的元数据.
  • 可访问性:确保数据可以通过标准协议(HTTP,FTP)检索,即使访问受到限制.
  • 互通性:使用开放的,社区标准的文件格式(如HDF5,CSV,NetCDF)和受控词汇.
  • 可重复使用:提供明确的许可证、出处文件和特定域的元数据。

采用公平执法的做法不仅有利于科学界,而且加强了你自己的工作流程,使人们更容易重新审视旧数据,跨团队合作,满足出版商的要求。

结论

数据管理和共享方面的最佳做法是一种投资,它能给研究生涯带来好处。 通过清晰的数据、透彻的记录、确保质量、使用版本控制以及安全支持,你保护你的工作并增加其价值。 共享可靠存储库中的数据,并有明确的许可证和引用,可以扩大你的研究影响,促进合作,并建立起对工程科学的信任。 由于资助者、期刊和研究机构继续强调开放性和可复制性,那些采用这些做法的人将最有能力领导和帮助一个充满活力、透明和创新的研究界。