执行输出
在 Execute 阶段结束时,会产生一个输出。其中包含按升序排列的最佳匹配(仅含代码)、其排名、层级度量、concat 度量,以及一个名为 "METRIC" 的度量,表示匹配的整体优良程度,其计算方式为层级距离中位数与 concat 距离的平均值。
附录 1:输入与输出数据集¶
Train 阶段的数据集:
- 一个输入数据集
- Execute 阶段的数据集:
- 一个输入数据集
- 一个输出数据集
数组可以定义若干字段,这意味着可以将更多数据集列与该字段关联。
附录 1.1:输入 Train 数据集¶
该数据集包含层级(逐点比较,不进行字符串拼接)和 concat(比较前先拼接)的代码与描述。代码字段为数组。每个描述字段必须仅对应一个代码字段。
- LEVEL_CODE_0:第一个层级描述字段的代码
- LEVEL_CODE_1:第二个层级描述字段的代码
- …
- LEVEL_DESCRIPTION_0:第一个层级描述字段
- LEVEL_DESCRIPTION_1:第二个层级描述字段
- …
- CONCAT_CODE_0:第一个待拼接描述字段的代码
- CONCAT_CODE_1:第二个待拼接描述字段的代码
- …
- CONCAT_DESCRIPTION_0:第一个待拼接描述字段
- CONCAT_DESCRIPTION _1:第二个待拼接描述字段
例如:
| LEVEL_CODE_0 | LEVEL_DESC_0 | CONCAT_CODE_0 | CONCAT_DESC_0 | CONCAT_CODE_1 | CONCAT_DESC_1 |
|---|---|---|---|---|---|
| E_1 | USA | A11 | HOME EXPENDITURE | CC_01 | UTILITY |
| E_1 | USA | A11 | HOME EXPENDITURE | CC_05 | HEAT |
| E_3 | APAC | A11 | HOME EXPENDITURE | CC_09 | GAS |
| E_1 | USA | B12 | FURNITURE | CC_03 | TABLES |
附录 1.2:输入 Execute 数据集¶
Execute 输入数据集的结构与 Train 相同。层级代码和描述的数量必须相同;concat 代码和描述的数量可以不同。
例如:
| LEVEL_CODE_0 | LEVEL_DESC_0 | CONCAT_CODE_0 | CONCAT_DESC_0 |
|---|---|---|---|
| NA | NORTH AMERICA | CD1 | SEWER |
| NA | NORTH AMERICA | CD2 | HEAT |
| AS | ASIA | CD2 | HEAT |
| NA | NORTH AMERICA | CD3 | GAS |
附录 1.3:用于 Pred 的输出 Execute 数据集¶
该数据集包含 train 与 execute 之间的匹配代码字段、匹配排名以及距离度量。
- LEVEL_CODE_0:第一个 Execute 层级描述字段的代码
- LEVEL_CODE_1:第二个 Execute 层级描述字段的代码
- ..
- LEVEL_DESCRIPTION_0:第一个层级描述字段
- LEVEL_DESCRIPTION _1:第二个层级描述字段
- …
- PRED_LEVEL_CODE_0:第一个 Train 层级代码字段的代码
- PRED_LEVEL_CODE_1:第二个 Train 层级代码字段的代码
- …
- CONCAT_CODE_0:第一个 Execute concat 描述字段的代码
- CONCAT_CODE_1:第二个 Execute concat 描述字段的代码
- …
- CONCAT_DESCRIPTION_0:第一个待拼接描述字段
- CONCAT_DESCRIPTION_1:第二个待拼接描述字段
- …
- PRED_CONCAT_CODE_0:第一个 Train concat 描述字段的代码。
- PRED_CONCAT_CODE_1:第二个 train concat 描述字段的代码
- …
例如:
- RANK:匹配的排名顺序
- LEVELS_METRIC:层级字段向量距离的中位数(针对每个匹配)
- CONCAT_METRIC:concat 字段的向量距离
- METRIC:LEVEL METRIC 与 CONCAT METRIC 的平均值
下方展示了 AI Automapping 模型工作原理的示意图*:

附录 2:参数¶
Train 阶段需要设置的参数包括以下内容:
-
LOG LEVEl:
-
DEBUG(记录所有信息)
- INFO(记录所有警告、错误、严重错误以及一般信息,不记录调试信息)
- WARNING(记录所有警告、错误和严重错误)
- ERROR(记录所有错误和严重错误)
- CRITICAL(仅记录严重错误)
严重程度低于参数指定级别的日志消息将被忽略;严重程度等于或高于该级别的日志消息将被输出。 - TRANSLATE BEFORE:是在使用 NLP 模型之前先翻译文本(Y),还是直接利用多语言模型(N)
例如:

Execute 阶段需要设置的参数包括:
-
LOG LEVEL:
-
DEBUG(记录所有信息)
- INFO(记录所有警告、错误、严重错误以及一般信息,不记录调试信息)
- WARNING(记录所有警告、错误和严重错误)
- ERROR(记录所有错误和严重错误)
- CRITICAL(仅记录严重错误)
严重程度低于参数指定级别的日志消息将被忽略;严重程度等于或高于该级别的日志消息将被输出。 - NUMBER OF CLASSES:为每个 Execute 输入行返回的匹配数量。默认值为 1。
-
TRANSLATE BEFORE:是在使用 NLP 模型之前先翻译文本(Y),还是直接利用多语言模型理解能力(N)
-
PRIORITIZE LEVELS:最终排名是否按层级匹配的顺序优先排序(Y)或不优先(N)
例如:
