一般常见的机器学习 领域 生产部署步骤

1.首先从项目中找到所谓的离线数据,这就要求比如我们企业有自己的数据仓库平台,从数据仓库平台提取数据 进行 聚合分析

2.将离线数据集加载到代码中,进行 ETL 抽取 转换 重加载,这个过程主要是数据清洗,很多时候 原始数据并不符合我们数据分析的要求,不达标,需要我们做一些预处理。

比如去除部分非相关特征标签 比如某一列
比如 对相关标签的空值处理 ,添加一列 FeatureMissing 空值为1,非空为0,
比如 对 相关分类标签 做 one-hot编码,把分类标签变为数值标签 (0,1)(1,0)
还有对 训练集和 测试集的标注,还有预测标签column的标注
还有对feature的统计分析 ,比如 max avg min std var count,
经过一系列的数据清洗预处理后 生成可以被数据分析的相关数据集

3.加载 经过ETL处理后的数据集, 选择适当的模型,构造模型参数,通过配置可以迭代的模型参数 优化调参,

4.通过数据可视化分析 得到的 AUC roc recall evalution predict 数值,确定参数,通过降维处理 防过拟合 处理 确定最终模型。

5.将习得的模型 导出 比如 PMML 预测领域模型描述文件,然后在测试环境项目中 java scala文件中对PMML文件读取 进行在线实时响应预测 ,100ms响应,目前支持PMML 的有spark ml、 keras 、sklearn、 Deeplearning4j 、tensorflow 、xgboost 、R 、flink

6.或者通过rpc http tcp 网络通信调用,由测试环境的后端 项目向 python或者R环境中的模型发起调用,响应速度较pmml 调用差,并且 并发性能有限。

7.通过A/B 测试后,确定最终模型 由后端完成相关wrap代码实现 并部署在生产环境下 热启动上线

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容