普通 LLM 把任务变成续写,读入文本后逐个预测 token,程序再从生成结果中解析答案。Jev 可能保留了 Transformer 主干,只改训练目标和输出端。它让问题、候选项与 state 的隐藏向量直接匹配,Choice 选候选,Noul 判真假,Score 算等级概率;多道问题还能共享一次 state 编码。这样省掉逐字生成、JSON 修复和重复读入,换来更低延迟。代价是候选项、标签或评分范围需要预先定义。

它和向量模型共享一种训练思路

常见的向量模型不会重新发明一套语言主干。它继承已经学会处理文本的 Transformer,改用池化和投影层输出向量,再通过对比训练整理向量空间。查询向量要靠近相关文档,远离不相关文档。完整过程见 向量模型与大语言模型怎样完成预训练。

Jev 可以沿用相似的训练形状。还是那张重复扣款工单,训练数据可以写成下面这样。

state       信用卡被扣了两次,已经三天没人处理
question    这张工单应该交给哪个部门
正例         账单争议组
困难负例     账户登录组、普通退款咨询组

无论三段文本分别编码,还是放在一起联合计算,最后都要得到每个候选项的分数。训练初期,“普通退款咨询组”可能因为出现了“退款”而得分更高。损失函数会压低它,提高“账单争议组”的分数。训练后的可见变化很具体,“账单争议组”会排到前面。这个排序结果不能反推出内部一定采用了双塔或某种固定向量结构。

这和向量模型使用正例、负例训练语义距离很接近。两者都不需要为内部向量准备一串标准答案,也不靠生成完整句子学习任务。训练数据只规定谁应该更接近,或者哪个候选项应该得分更高。反向传播随后修改产生这些向量和分数的共享参数。

区别出现在结果怎样使用。向量模型通常让查询和文档分别编码,文档向量可以提前存入向量数据库。它优化的是相对距离,相似度 0.83 不能直接理解成 83% 的正确概率。

Jev 更像一个判别式重排序器。候选分数经过 softmax 后可以在当前列表内归一化。并且要让 0.8 真正接近八成正确率,可能会在独立数据上做温度缩放等校准。

两者有相似的训练信号。它们都可以使用正例、困难负例和排序损失修改 Transformer。不同的是一个映射输出固定长度向量,一个输出固定的排序后结果。