跳转至

ML 工作流任务

在本节中,我们将说明如何:

  • 正确设置工作流任务,以及
  • 运行任务并确保 ML 推理发生。

ML 推理任务确保 ML 引擎的数据集输入在训练阶段训练模型。该阶段的结果将是训练好的模型,其引用存储在训练标签中,其创建在高级分析部分的"训练标签"中指定。训练阶段之后,您可以运行执行任务,其中 ML 引擎运行推理;此阶段可以以数据集、训练模型的引用作为输入,并生成数据集。

基于上传到模型库的模型,ML 推理将生成一些要插入到数据集中的行。如果产生 OID 行,这些行将被插入到数据集中并更新现有行;而如果产生的行没有 OID,这些行将被拒绝。在某些情况下,同样基于上传的模型,ML 推理产生的行将作为新行插入到数据集中。

入口点

在创建 ML 任务之前,管理员用户必须先上传模型,如模型库部分所示,然后必须创建 Train 和/或 Execute 类型的高级分析,如"高级分析"部分所示,最后必须创建训练标签,如高级分析中"训练标签"部分所示。

要创建任务,管理员用户必须访问业务工作流区域,点击所需的工作流,点击"操作"然后选择"步骤"。用户必须选择并点击步骤树中的某个步骤。将弹出一个窗口,左侧显示由代码标识的工作流,中间以树形结构显示工作流的详细信息。

现在,管理员用户可以选择要插入 ML 数据处理任务的工作流,然后点击右上角的"编辑"按钮。将出现一个栏,显示所有可以插入到工作流中的任务。要找到 ML 任务,只需点击"其他活动".

ML 数据处理可用的任务如下:

  • ML 训练处理
  • ML 执行处理

第一个允许您运行 ML 推理任务,该任务运行模型的训练。给定一个模型,系统将要求提供分析工作区、先前在相关部分设置的高级分析训练(如"高级分析"所示),以及标签训练,允许用户选择在高级分析中"训练标签"区域创建的特定训练。

ML 训练处理

此类任务允许您运行训练数据处理,以便使用 ML 引擎训练模型。训练完成后,模型将存储到特定的存储中,其链接将通过先前创建的"训练标签"保存在 Tagetik 中,如高级分析所述;为此,需要先配置任务。到达入口点后,可以识别 MI 训练任务并将其拖到所选工作流中。

之后,将弹出一个用于定义任务的窗口。

弹出窗口包含所有需要填写的字段:

  • 代码:任务的唯一代码;此字段为必填项。
  • 描述:MI 训练任务的描述;此字段为必填项。
  • 分析工作区:分析工作区选择字段。
  • 高级分析任务:在高级分析训练区域配置的 Train 类型高级分析;此字段为必填项。
  • 训练:用户可以在此选择将存储训练模型的训练标签;此字段为必填项。

此外,选择数据处理前清除输出数据复选框将删除数据集分区中的数据。此删除仅影响与运行数据处理的实体相关的行,并符合用户权限设置的限制。

填写完所有字段后,点击"确定"。弹出窗口将关闭,任务将显示在工作流中。现在,需要将任务链接到工作流,然后点击右上角的"保存"按钮。

ML 执行处理

此类任务允许您运行执行数据处理,以便运行训练模型的预测;要执行预测,模型将使用训练好的模型,该模型存储在专用存储中,其链接通过先前在 ML 训练任务中使用的"训练标签"存储在 Tagetik 中,如ML 训练处理所示;为此,需要先配置任务。到达入口点后,可以识别 ML 执行任务并将其拖到所选工作流中。

之后,将弹出一个用于定义任务的窗口。

弹出窗口包含所有需要填写的字段:

  • 代码:任务的唯一代码;此字段为必填项。
  • 描述:MI 训练任务的描述;此字段为必填项。
  • 分析工作区:分析工作区选择字段。
  • MI 模型:将用于执行预测的训练模型;此字段为必填项。
  • 训练:此字段允许您通过训练标签选择最合适的模型。它是必填项,如果所选模型同时具有训练阶段和执行阶段,则会显示。
  • 高级分析任务:在高级分析执行区域配置的 Execute 类型高级分析;此字段为必填项。

与 ML 训练一样,选择数据处理前清除输出数据复选框将删除数据集分区中执行实体的数据。

填写完所有字段后,点击"确定"。弹出窗口将关闭,任务将显示在工作流中。现在,需要将任务链接到工作流,然后点击右上角的"保存"按钮。

如果为执行数据处理选择的模型同时具有 TRAIN 阶段和 EXECUTE 阶段,则在运行执行任务之前,必须使用执行数据处理中选择的同一模型运行训练任务,否则系统将生成错误。

一旦任务(无论是执行还是训练)已创建并链接到流程,就可以运行了。为此,需要访问用户界面,从主页点击流程,选择链接了包含 ML 任务的业务工作流的流程。

然后,在定位到 ML 任务后,用户必须点击并选择"运行"。

点击"运行"后,系统执行运行前验证,以验证 AA 中映射的输入和输出数据集是否在线:如果其中仅有一个离线,则会出现错误消息,并阻止数据处理运行。

然后系统检查模型的状态。具体而言,如果模型的状态不是 3,即不处于就绪状态,则会出现错误消息。

如果状态为 3,即处于就绪状态,系统将通过机器学习启动模型的训练数据处理;通过点击按钮,可以在右上角的数据处理列表中看到此内容。该列表还包含一行"代码"为:OWS_ML_TRAIN_EXECUTION。

数据处理将仅在分区中输出与运行数据处理的实体相关的信息。

数据处理所需的时间因上传模型的复杂性而异。最后,将弹出一个窗口告知用户数据处理已完成。

为确保数据处理已正确写入内容,管理员用户必须打开审计并检查列表中是否包含两行:

  • 其中一行的"描述"为:ML_TRAINING;这表示在所选训练标签中记录训练模型的引用。
  • 其中一行的"描述"为:ML 训练处理;这表示将机器学习的结果记录到数据集中。

运行执行任务时,系统运行所选模型的预测数据处理;通过点击按钮,可以在右上角的数据处理列表中看到此内容。该列表还包含一行代码为:OWS_ML_EXECUTE_EXECUTION。数据处理所需的时间因上传模型的复杂性而异。

最后,将弹出一个窗口告知用户数据处理已完成。

为确保数据处理已正确写入内容,管理员用户必须打开审计并检查列表中是否包含两行:

  • 其中一行的"描述"为:ML 执行处理;这表示将机器学习的结果记录到数据集中。

当数据处理开始且在其结束之前,可以在审计的自由参数部分显示 modelId 和 correlationId。

审计窗口显示 CorrelationID、ElaborationID、行数,并允许您对每个分区进行更改。

如果数据处理成功完成但未产生任何输出,审计将显示警告消息。

ML 数据处理(包括训练和执行)可以通过 JOB 配置,然后进行调度。