资讯详情

数据科学家在机器学习中的工作时间统计

📅 2026/9/27 8:51:57 | 华诺云谱 👁 阅读
数据科学家在机器学习中的工作时间统计
以下统计数据大致描述了数据科学家在一个机器学习项目中不同工作环节所占的时间比例工作内容时间占比清理和组织数据60%收集、整理或构建数据集19%在数据中发掘模式9%其他工作5%优化模型4%重塑训练数据集3%合计100%这组数据反映出一个重要事实机器学习项目的大部分工作并不是选择算法或优化模型而是处理数据。一、60%清理和组织数据“清理和组织数据”占全部工作时间的60%是数据科学家投入时间最多的环节。现实中的原始数据通常无法直接用于训练机器学习模型可能存在以下问题数据缺失重复记录格式不统一数值单位不一致字段名称混乱数据中存在错误极端值或异常值过多不同数据表之间无法直接关联文本、图片或类别标签存在错误数据中包含无关信息。例如一个电商平台的商品价格可能被记录为“100元”“100”“100.00”或者“100 RMB”。虽然这些数据表达的是同一个意思但计算机无法自动确认它们完全一致因此需要将其转换为统一格式。用户年龄字段也可能出现以下情况原始年龄记录存在的问题25正常数据二十五数据格式不一致250可能是录入错误空白数据缺失-5不符合实际未知无法直接进行数值计算数据科学家需要判断如何处理这些数据是修改、删除、填补还是将其标记为未知。如果处理不当模型就可能学习到错误规律。为什么这个环节占比最高因为机器学习模型的效果高度依赖数据质量。即使使用非常先进的算法如果输入数据错误、混乱或存在严重偏差输出结果也不会可靠。这可以用一句常见的话概括垃圾数据输入必然导致垃圾结果输出。清理和组织数据通常包括删除重复数据处理缺失值纠正错误记录统一字段和数据格式处理异常值合并多个数据来源对数据进行编码和标准化检查标签是否正确删除无关或者泄露答案的特征将数据整理为模型能够读取的形式。因此这里的60%说明机器学习首先是一项数据工程工作其次才是模型训练工作。二、19%收集、整理或构建数据集题目中的“19% 数据集”表述不够完整一般可以理解为收集、获取、整理或者构建数据集占19%。机器学习模型需要从数据中寻找规律因此在训练模型之前数据科学家必须确定需要哪些数据、从哪里获得数据以及数据是否具有代表性。数据集可能来自企业业务数据库网站和应用程序日志用户调查传感器和智能设备网络公开数据实验记录商品销售记录医学检查数据人工采集和标注第三方数据服务。例如要建立商品销售预测模型可能需要收集历史销量商品价格促销活动库存信息日期和节假日天气情况门店位置竞争商品价格用户评价市场趋势。这项工作的难点不仅是“获得更多数据”还要确保数据与问题有关、来源可靠并且能够代表真实应用环境。数据集需要满足的基本条件一个质量较高的数据集通常应该具备以下特点相关性数据与需要解决的问题有关准确性记录尽可能真实没有大量错误完整性重要字段不能严重缺失代表性能够覆盖模型实际应用中的主要情况一致性不同来源和时间的数据含义保持一致及时性数据不能严重过时合法性数据的收集和使用符合隐私及法律要求平衡性不同类别拥有相对合理的样本数量。例如在训练猫狗图像分类模型时如果数据集中猫的图片有九千张而狗的图片只有一千张模型可能过度倾向于判断为猫。因此数据科学家需要检查类别是否平衡并采取补充样本、调整权重等方法。这部分占19%说明寻找和构建合适的数据集同样需要投入大量时间。三、9%在数据中发掘模式数据科学家需要对数据进行分析发现变量之间的关系、发展趋势和异常现象这一过程通常称为探索性数据分析。主要工作包括计算平均值、中位数和方差分析数据分布比较不同群体的差异观察变量之间的相关性分析时间变化趋势识别异常值使用图表进行可视化提出值得验证的假设寻找可能影响预测目标的重要因素。例如在分析商品销量时数据科学家可能发现周末销量高于工作日价格降低时销量通常上升某些商品具有明显季节性促销期间销量显著增加不同地区的用户偏好不同极端天气会影响部分商品需求。这些模式能够帮助数据科学家理解问题并决定应该选择哪些特征、模型和评价方法。为什么需要人工发掘模式机器学习模型可以自动学习规律但数据科学家仍然需要理解数据。否则模型可能利用错误关系进行预测。例如一个模型发现“商品编号”与销量高度相关但商品编号本身可能只是系统随机生成的没有真实业务含义。如果不进行分析模型可能在历史数据上表现很好却无法适应新商品。因此发掘模式不仅是寻找规律也是在检查这些规律是否真实、合理并具有实际意义。四、5%其他工作“其他”包括无法完全归入前面几类的工作例如与业务人员沟通需求明确机器学习项目目标编写分析报告制作数据可视化图表参加项目会议查阅技术资料部署模型监控上线后的模型向管理人员解释结果编写和维护程序代码检查隐私、安全及合规问题与数据工程师和软件工程师协作。虽然统计中只占5%但这些工作对项目成功非常重要。例如如果数据科学家没有正确理解业务需求即使模型准确率很高也可能无法解决实际问题。假设企业真正关心的是“提前发现即将流失的高价值客户”但数据科学家只是预测“所有客户是否流失”那么模型指标可能不错业务价值却十分有限。此外模型只有真正接入业务系统并被使用才会产生实际价值。一个停留在实验环境中的模型无论性能多好也不能称为完整的机器学习应用。五、4%优化模型模型优化只占4%这一点经常令人意外。很多人认为机器学习工作的核心就是反复调整算法但实际工作中模型优化所占的时间通常比数据处理少得多。模型优化可能包括选择合适的机器学习算法调整学习率修改模型深度或复杂度调整正则化参数选择损失函数改变批量大小使用交叉验证比较不同模型调整分类阈值减少过拟合或欠拟合提升推理速度降低模型资源消耗。例如数据科学家可能比较逻辑回归、决策树、随机森林和神经网络选择验证集表现更好的模型。之后再调整模型参数使其准确率、召回率或者运行速度达到业务要求。为什么优化模型只占4%因为模型效果往往更受数据质量影响。如果数据质量差反复调整参数只能带来有限改善。相反增加高质量样本、修正错误标签或者删除不合理数据通常能够带来更明显的提升。机器学习项目中常见的情况是改善数据的收益可能高于不断增加模型复杂度的收益。因此数据科学家通常不会把全部时间用于追求更复杂的模型而是先确保数据和评价方法可靠。六、3%重塑训练数据集“重塑训练数据集”指根据模型需求对已经收集和清理的数据进行重新组织、转换或划分使其适合训练。它可能包括以下工作调整数据结构选择训练特征创建新的特征对类别数据进行编码对数值进行标准化调整样本类别比例进行过采样或欠采样划分训练集、验证集和测试集把图片调整为统一尺寸把文本转换为词元或向量将时间序列转换为固定长度窗口对训练样本进行数据增强。例如某个客户流失数据集包含姓名、年龄、消费金额、登录次数和是否流失等字段。姓名通常不能直接用于预测而年龄、消费金额和登录次数可能需要标准化“是否流失”则要转换成模型能够处理的类别标签。通常需要把数据划分为训练集用于模型学习验证集用于选择模型和调整参数测试集用于最终评价模型对未知数据的表现。必须避免把测试集信息提前提供给模型否则会发生“数据泄露”导致评价结果虚高。与“清理和组织数据”的区别二者容易混淆但侧重点不同清理和组织数据解决数据错误、缺失、重复和格式混乱等质量问题重塑训练数据集把已经处理好的数据转换为适合特定模型训练的结构。例如删除错误年龄属于数据清理将年龄进行标准化则属于训练数据转换。删除重复图片属于数据清理对图片进行裁剪和缩放则属于训练数据重塑。七、这组数据说明了什么1. 数据处理占据机器学习工作的主体如果将相关工作合并清理和组织数据60%收集或构建数据集19%重塑训练数据集3%。三项合计为60%19%3%82% 60\%19\%3\%82\%60%19%3%82%也就是说数据科学家大约82%的工作时间直接用于数据获取、整理、清理和转换。这充分说明机器学习项目的核心基础是数据而不只是算法。2. 模型优化只是机器学习项目的一小部分模型优化仅占4%。这并不表示模型不重要而是说明如果没有可靠的数据再先进的模型也无法发挥作用。一个完整的机器学习项目通常需要经历明确业务问题收集数据理解数据清理数据组织和转换数据划分训练集与测试集训练模型调整模型评价模型部署并持续监控模型。训练和优化模型只是整个流程中的一部分。3. 数据质量决定模型质量上限如果训练数据存在严重偏差模型会继承这些偏差。例如某个招聘模型主要根据过去录用记录训练而历史记录中存在群体偏见模型就可能继续复制这种偏见。如果数据标签大量错误模型也会学习错误对应关系。如果训练数据与现实环境不一致模型上线后就可能失效。因此数据科学家投入大量时间清理数据并不是低价值或机械性的工作而是在保证机器学习系统的可靠性。4. 数据科学家的工作具有综合性数据科学家并不只是“训练模型的人”还需要具备多方面能力理解业务问题获取和管理数据使用统计方法分析数据编写数据处理程序训练和评价模型制作可视化结果向非技术人员解释结论关注隐私、公平性和安全风险与工程团队共同部署模型。因此数据科学是计算机科学、统计学、数学和业务知识相结合的领域。八、一个具体例子预测商品销量假设某企业希望利用机器学习预测下个月的商品销量数据科学家的工作可能按照以下方式展开。1. 收集数据获取过去几年的商品销量、价格、库存、促销、节假日和天气数据。这部分对应数据集的收集与构建。2. 清理和组织数据处理以下问题删除重复订单修正错误商品编号统一日期格式填补缺失价格处理退货订单统一不同门店的数据结构检查销量是否存在异常值。这是整个项目最耗时的部分。3. 发掘数据模式通过分析发现夏季饮料销量更高周末部分商品销量增加促销期间销量明显上升雨天某些门店客流量下降节日前礼品类商品销量快速增长。4. 重塑训练数据集将时间、天气、价格和促销信息转换为模型特征并按照时间顺序划分训练集、验证集和测试集。5. 训练和优化模型比较多个预测模型调整参数选择误差较小且运行成本合理的模型。6. 完成其他工作将模型接入库存管理系统向采购人员解释预测结果并持续监控模型表现。这个例子说明最终呈现出来的模型可能只是一个预测接口但其背后大部分工作都发生在数据处理阶段。九、总结这组统计数据可以概括为60%用于清理和组织数据解决缺失、错误、重复和格式不统一的问题19%用于获取、整理或构建数据集确保模型拥有足够且有代表性的数据9%用于在数据中发掘模式了解趋势、关联、分布和异常5%用于沟通、报告、部署和监控等其他工作4%用于优化模型选择算法并调整参数3%用于重塑训练数据集将数据转换为适合模型训练的结构。其中与数据准备直接相关的工作大约占82% 82\%82%这说明在实际机器学习项目中高质量数据通常比复杂算法更加重要。数据科学家的主要工作并不是简单地调用模型而是将混乱、分散的原始数据转化为准确、完整、具有代表性并且可以用于训练的数据。只有完成这些基础工作机器学习模型才能产生可靠、有价值的结果。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑