Laya

Laya

本地毫秒级决策引擎

AI官网

应用介绍

拿大模型做分类、路由、审核这类判断,每次都要写一段 prompt、求它输出 JSON、再写解析和重试,运气不好还得防它把标签编出一个没见过的。Laya 干脆不生成文本:你给它一段状态和几个带类型的问题,它一次前向传播就把答案返回来,每个选项带概率,整题带置信度。没有文本生成,也就没有东西要解析、没有东西可编造。

题型只有三种——choice 从你给的选项里选一个,score 在你定的量表上定位,noul 回答"这句话成立的概率是多少"。阈值定在哪、置信度低于多少转人工,全是你自己代码里的一行判断,不交给模型决定。一个 Apache 2.0 的 Python 包,pip install laya 就能跑,模型和数据都留在自己机器上。

软件功能



一次前向传播出答案:非自回归编码器架构,一道题在 T4 上约 33 毫秒,成批提问平摊到每题 7.2 毫秒。这是本地 GPU 的数字,换到 CPU 上是 193 到 464 毫秒,选硬件前先看清这一条。

三个 checkpoint 按需取用:laya 基于 ModernBERT-large,421M 参数、512 上下文,专供英文;laya-multilingual 基于 mmBERT-base,322M 参数、1024 上下文,覆盖 100 多种语言且快一倍;laya-typed-decisions 面向成套的结构化判断流程。

按文字脚本选模型:Router 在前向传播之前用不到 0.5 毫秒的纯 Python 判断输入是什么文字,再决定交给哪个 checkpoint。这一步不能省——英文 checkpoint 读高棉语时准确率是 0.000,自报的置信度却有 0.952,模型自己不会告诉你它看不懂。

预加载决定延迟:Router(preload=True) 把三个 checkpoint 一次性装进显存,之后每次 32.8 毫秒;用惰性加载的话,每换一次语种就要重新载入,一次 7 到 10 秒。

自托管,按机器付费不按 token:Apache 2.0,模型权重在 Hugging Face 上公开,装在自己的机器上跑,请求量再大也不产生调用费,数据一步都不出内网。

作者把短板也写进了 README:选项超过 20 个的高基数标签空间上,它明显不如托管的决策 API(Banking77 上 0.425 对 0.870);序数型的 score 是最弱的一题型;基础 checkpoint 零样本接近随机,作者自己的说法是"这是一个可以快速微调的底座,不是开箱即用的零样本决策引擎"。