OpenJev

OpenJev

直接读取选项概率的本地决策模型

AI官网

应用介绍

Agent 里绝大多数判断其实很小:这条工单派给哪个队列、这次要不要重试、现有证据够不够支持结论。让大模型来答,它得先写一段 JSON,你的程序再把这段文字解析回一个 if 判断——中间那几十上百个 token 纯属为了绕一圈。OpenJev 的做法是把这一圈省掉:直接读模型在你给定的那几个选项上的 logits,归一化成概率,一次前向传播就出结果,不采样任何回答 token。

作者把它和常规做法在同一块 RTX 3090、同一个冻结的 Qwen3.5-4B 上做了对照:21 个二选一判断,直接读概率的中位耗时 1.023 秒、输出 0 个 token;让模型生成一个紧凑 JSON 数组要 5.332 秒、111 个 token,慢 5.21 倍。判据和选项描述都是请求时才给的,不用预训练分类头;同一段长状态还能预填一次再并行分叉到多个判据上,实测把 777 次决策从 333 秒压到 38.8 秒。基准数据、原始计时和逐行预测都提交在仓库里。

软件功能



直接读取选项 logits:模型在给定选项上的原始打分被直接取出并只在这些选项之间归一化,不生成回答句、不解析 JSON、不做修复重试,一次前向传播给出概率。

判据运行时定义:判断标准和选项描述随请求一起传进来,不需要为每类判断单独训练或微调一个分类器,改判据就是改一段文本。

共享状态并行分叉:同一段长状态可以预填一次再分叉到多个判据上并行求值,在 37 状态 × 21 判据的实测里把吞吐从每秒 2.33 次提到 20.03 次。

可审计的输出:每条结果带上各选项的打分、耗时、所用模型的确切 revision 和提示词哈希,回头复盘时能对上是哪一次、用的哪个权重。

公开的基准与失败样例:自有测试集、运行脚本、逐行预测、原始计时以及已知失败案例都提交进仓库,数字可以自己重跑核对,而不是只给一张表。

浏览器里直接试:官网提供网页版,用 WebGPU 在本地跑一个小号 Qwen 模型,同一道题可以把「直读概率」和「生成 JSON」两条路各跑一遍,亲眼比时间,不用排队申请。

命令行批量评分:提供 openjev-score 命令,读 JSONL 输入批量出结果,支持指定模型和 revision,状态完全相同时还能切到共享预填模式。

开源可自建:MIT 协议,用公开权重复现这套接口范式,本地 3090 级别的显卡就能跑 4B BF16 模型。