数据准备

既可以将单个描述映射到单个维度或一组维度,也可以将一组描述(由多个维度组成)映射到单个维度或一组维度。 我们希望映射的结果描述以及我们希望其映射到的维度组合被视为单行。 为便于阅读,此处不再讨论代码,但现在说明:必须将每个描述与其相关的代码字段关联起来。

我们可以输入描述的位置有两种类型的字段:层级字段和 concat 字段。

区别在于,层级描述字段是单独处理的,而 concat 描述字段会拼接起来形成一个新的描述。 Train 与 Execute 之间的层级字段数量必须相同。concat 字段的数量在 train 与 execute 之间可以变化。 层级字段是逐一比较的,而 concat 字段则是将所有 concat 字段拼接在一起后进行比较。

因此,使用层级字段时,我们赋予单个字段更大的权重;使用 concat 字段时,我们赋予所有拼接在一起的字段相同的权重。

用户定义一组配置参数(参见附录 2),包括描述的语言以及是否在文本比较之前启用自动翻译。

系统使用单一的多语言 NLP 嵌入模型,能够原生处理和比较多种语言的文本。 因此,文本比较对所有支持的语言开箱即用,无需任何预先翻译。 在数据准备期间,软件会自动清理描述字段,移除缺失值和特殊字符,并将描述拼接为单一的文本表示。

一个可选参数允许在嵌入生成步骤之前将所有描述翻译为英文。当该参数设置为 Y 时,文本会先翻译为英文,然后使用嵌入模型进行比较。

翻译的使用不是强制性的,也不会影响映射过程的功能正确性。 它仅作为可选的优化提供。在某些场景下,将文本翻译为英文可能会使比较准确度略有提升,因为嵌入模型在英文下的表现通常可能略优于其他语言。

然而,自动翻译具有显著的计算成本并会增加执行时间,因为它需要完整的 Transformer 模型进行语言生成,而非轻量级的仅嵌入模型。 因此,对于大型数据集通常不建议启用翻译,仅应在处理有限数据量时考虑。

启用后,翻译过程完全由系统内部处理,对用户完全透明。描述始终以其原始语言显示,无论是在训练还是执行期间。