Laya 是一款面向分类与决策任务的非自回归模型,主要用于从文本中快速识别类别、风险等级和处理优先级。它不需要像大语言模型一样逐字生成回答,而是直接输出判断结果及对应概率,适用于邮件分流、网络钓鱼检测、内容审核和客服路由等场景。
Laya 源自 Nandakishor M 在 2025 年公开的强化学习决策研究。此后,TypeSafe AI 发布了采用相似非自回归思路的闭源模型 Jev,Nandakishor 则进一步重构原有方案,将其扩展为一个完全开放、面向通用横向场景的 System 1 决策模型:RL Agent。
Laya 包含 421M 参数,基于双向编码器构建,并使用 RLCD 训练概率输出。在 GPU 上,其推理延迟为 33~38 毫秒;按 Jev 公布的 150 毫秒延迟计算,速度约快 4 倍。
模型采用 Apache 2.0 协议开源,可在本地部署,并通过校准概率为自动化决策提供更可靠的置信度依据。
模型链接:https://modelscope.cn/models/convaiinnovations/laya 代码仓库:https://github.com/NandhaKishorM/laya
当客服工单到达、邮件进入收件箱,或者用户向 API 提交提示词时,通常只需要回答几个简单问题:
这应该交给哪个部门? 这封邮件是不是网络钓鱼攻击? 这个提示词是否试图越狱系统? 按 0~3 级衡量,这个问题有多紧急?
真正需要的是一种像人脑 System 1 那样工作的模型:能够即时做出反射式决策,给出诚实、经过校准的概率,并且在标准硬件上只需 30~40 毫秒。
它使用三种原语:
choice :从一组以字典形式定义的标准中选择一个选项,返回选中的标签、每个候选选项的概率以及置信度分数。非常适合部门路由、意图识别和主题分类。
score :按照 0、1、2、3 之类的有序量表为状态评分,返回期望分值、各等级的概率和置信度。非常适合评估客户不满程度、紧急度和提示词危害严重性。
noul :直接回答一个布尔问题,返回经过校准的 P(true) ,取值范围为 0.0~1.0。非常适合检测网络钓鱼、垃圾邮件、越狱或客户流失风险。
RL Agent 采用了一个包含 4.21 亿参数、由两个紧密耦合组件组成的端到端架构:
ModernBERT-large 主干网络
[MASK] 选项提取机制
选项评分器 MLP 将每个 1024 维标记状态投影成一个标量 Logit。对属于该问题的所有选项执行Softmax,即可得到候选概率分布:
“行动”与“升级处理”决策头
最高概率:max(p) 前两名差值:p_top1 - p_top2 归一化熵:H(p) / log(K) 选项预算比:K / 255
多个问题只需一次前向传播
普通分类与朴素强化学习的陷阱
如果尝试使用二元奖励的标准强化学习(预测正确奖励 +1 ,错误奖励 0 ),期望奖励为:
严格适当评分规则
在决策理论中,当模型报告分布 q 、真实结果为 y 时,评分规则 S(q, y) 会给出一个分数。当且仅当 q 等于真实分布 p 时,期望得分能唯一达到最大值,这个评分规则才是严格适当的:
复合奖励结合了三种适当评分:
1. 对数评分(S_log )
2. 球面评分(S_sph )
3. 排序概率评分(S_rps )
策略梯度更新(采用组基线的 REINFORCE)
带噪分布:
自动行动且结果正确:+1.0 自动行动但结果错误:-3.0 升级给人工处理:-0.5
在 RL Agent 中,这个问题得到了解决:
对话按轮次被切分成逐步增长的前缀(第 1 轮、第 2 轮、第 3 轮……),模型只能接收截至当前轮次的上下文。
训练使用以蒙特卡洛回报为目标的时序差分学习,即 TD(lambda = 1.0):
如果模型完全无法确定,所有选项的概率都是 1/K 。此时熵等于 log(K) ,置信度正好为 0.00 。
如果模型完全确定,某一个选项的概率为 1.0 ,此时熵为 0,置信度为 1.00 。
训练流水线使用 100% 由人类标注的真实公开数据集,覆盖以下领域:
客服分流与意图: 真实客服对话、银行业务意图和工单路由队列。 推断与事实核查: 前提—假设对、事实验证和矛盾检查。 内容安全: 针对有毒言论、骚扰和严重辱骂的人类共识标签。 安全与护栏: 真实的越狱提示词和提示词注入攻击。 量表与质量: 对帮助性、复杂度和正确性进行多维度人工量表评分。 多轮轨迹: 具有已验证最终结果的 SaaS 销售与客服互动。
随后,评估结果与 TypeSafe Jev 发布时公开的数据进行了直接对比。
正面对比
详细任务内表现(评估 23,024 个问题)
零样本泛化(2,400 个从未用于训练的问题)
选择性自动化的实际表现
接受全部答案:准确率 83.8%。 只接受置信度最高的前 80% 预测:准确率 89.4%。 只接受置信度最高的前 50% 预测:准确率 92.2%。
从魔搭下载模型
快速开始代码
自动化门控逻辑
👇点击关注ModelScope公众号获取 更多技术信息~