ConceptNet已发布一个开源的、经过微调的distilbert-base-multilingual-cased模型,专为面向企业的语音意图分类而设计。该系统利用四层层次结构将命令分类为基本意图、上下文感知意图、预测性意图和自主意图。

  • 该架构提供两种推理路径:一条是快速TF-IDF + Logistic Regression路径,在CPU上耗时不到5ms即可达到83%的准确率;另一条是神经DistilBERT路径,在不到100ms内达到98.6%的准确率。
  • 模型被限制为仅输出四个有效标签,以防止幻觉生成。
  • 它支持九种语言:英语、法语、西班牙语、德语、意大利语、葡萄牙语、中文、阿拉伯语和俄语。
  • 训练数据集包含这九种语言共730个标注样本。

作者正在寻求NLP社区的反馈,并邀请企业团队通过沙箱环境免费试用该工具。