这个来自 Convai Innovations 的开源决策引擎,是 2026 年 9 月 star 数最高的机器学习仓库之一。它把自己定位成非自回归的 System 1 模型:不生成文本,而是用一个 4.21 亿参数的编码器 读入文本和一组带类型的问题,直接给出每个选项的概率。 三类问题,一次算完 Laya 支持的问题类型是固定的几种:标签之间的选择(choice)、量表上的打分(score)、是/否判断(noul)。一次前向传播、零输出 token,返回每个选项的概率。 它的卖点是速度和校准过的概率,被描述为 TypeSafe 的 Jev 的开源答案。 装完就发现的第一件事 加载检查点时会打印随包发布的温度参数。概率等于 softmax(logits / T),T 大于 1 让概率变软,T 小于 1 让概率变尖。 问题出在 choice 类型里选项数 11 个及以上的那一档:检查点发布的值是 0.10 ,超出了有效范围,加载器把它钳到 0.5 并给出警告。0.5 小于 1,意味着任何选项数达到 11 个的选择题,概率都会被 锐化两倍 ——模型看起来会比它实际的把握更确定。 这个细节在做出任何预测之前就暴露了。 可复现性上的两个选择 安装的是发布版 laya 0.3.27,加载英文检查点。有两处设置决定了结果能否复现: 默认情况下 laya.load 跟随 Hugging Face 主分支,这里改为固定到库作者自己审阅过的那个提交,通过 laya.PINNED_REVISIONS 暴露。 在 CUDA 上 Laya 会自动转成半精度,关掉之后所有设备都跑 fp32,GPU 结果能和 CPU 结果在浮点噪声范围内对上。 测试用的真实标注数据来自 CLINC150 意图数据集的银行业务领域,答案已知。要测的是生产环境里的路由器实际会拿到什么:零样本准确率对比训练过的分类器、选项措辞和顺序的影响有多大、发布的概率有多诚实、在验证数据上拟合温度能修好什么又会悄悄弄坏什么、按错误预算拟合的弃权门、范围外流量、温度修不好的是/否问题,以及来自 pydantic schema 的类型化输出。 一个不生成任何 token 的模型,把全部赌注押在概率是否可信上。而它发布的第一组温度参数里,就藏着一个被钳制的值。 特别
狼队冲击升级区,马内正在成为最具爆点的进攻武器
每一次突破,每一次投篮,都将你带向更高的舞台!...
A股:紧急提醒2.5亿股民!从明天10月9日起,A股可能再次历史重演?
每一次突破,每一次投篮,都将你带向更高的舞台!...