孤本网
/ 1 阅读
0
0

决策 AI 模型专项化趋势加速:TypeSafe 与 Fastino 新品性能差异引争议

一句话结论

决策 AI 模型正从生成段落转向直接输出结构化决策,TypeSafe 的 Jev 与 Fastino 的 GLiDE 在延迟和准确率上表现各异。

关键要点

  • TypeSafe 推出的 Jev 模型支持 Choice、Score 和 Noul 原语,其中 Noul 最多支持 255 个选项,输入定价为每百万代币 0.042 美元,输出免费。
  • Fastino Labs 在 3 周内发布了 GLiDE 和 GLiNER2.5-Decide,GLiDE 拥有 40K 上下文窗口,具备自适应思考能力。
  • 在 Fastino 发布的“Fast Decisions”17 个数据集测试中,GLiNER2.5-Decide 准确率为 60.1%,开源复刻版 JevK5 为 57.5%。
  • TypeSafe 显示 Jev 端到端延迟为 70 至 500 毫秒,在匹配准确率下,其中位决策延迟较 DeepSeek 减少 22.4%,较 Gemini 减少 61.9%。
  • GLiNER2.5-Decide 基于 340M 参数的 DeBERTa-v3-large 架构,在 NVIDIA V100 显卡上 p50 延迟仅 38.3 毫秒,支持本地部署。

背景与事实

决策 AI 模型的核心特征在于其返回具体的决策结果而非自然语言段落。这类模型接收带有类型定义的问题,并返回选择项、分数或概率值,以便开发者直接用于代码分支逻辑。TypeSafe AI 率先推出了名为 Jev 的 System One 模型,该模型采用强化学习代码决策(RLCD)训练方法。由于 Jev 并非通过生成字符串来工作,因此在理论上避免了类型错误。Jev 的上下文窗口为 32K,输入代币价格为每百万 0.042 美元,而输出代币免费。在具体任务表现上,Jev 在客服任务中的准确率为 76.0%,在发票处理任务中为 61.8%,这些数据比顶级前沿配置低了 6.3 分。根据 Vercel 的报告,Jev 上线后 24 小时内被 13% 的付费团队使用。此外,在 TypeSafe 的工作流评估中,Jev 与 Anthropic 的 Sonnet 5 模型得分均为 67.8%,而最佳大语言模型配置得分则达到 74.1%。

与此同时,Fastino Labs 在 3 周内迅速发布了 GLiDE 和 GLiNER2.5-Decide 两款模型。GLiDE 拥有 40K 的上下文窗口,并具备自适应思考能力。GLiNER2.5-Decide 则基于 3.4 亿参数的 DeBERTa-v3-large 架构构建,在 NVIDIA V100 显卡上其 p50 延迟低至 38.3 毫秒,且支持本地运行。除了这两款模型,市场上还存在多种开源竞品。Laya 模型基于 4.21 亿参数的 ModernBERT-large,支持超过 100 种语言;JevK5 基于 40 亿参数的 Qwen3.5-4B;OpenJev 基于冻结参数的 Qwen3.5-4B,其处理速度比自回归 JSON 方法快 5.21 倍;kev-0.5b 基于 5 亿参数的 Qwen2.5-0.5B,在 Apple M5 芯片上处理 6 个问题仅需约 160 毫秒。

在性能对比方面,Fastino 发布了多项测试数据。在 Decision Index 0.2.1 测试中,GLiDE 得分 64.81,Jev 得分 57.91。在 CLadder 准确率测试中,GLiDE 达到 88.7%,而 Jev 为 72.6%。在 CRUXEval 准确率测试中,GLiDE 为 92.6%,Jev 为 73.0%。然而,值得注意的是,Fastino 的“Fast Decisions”对比使用的是开源复刻版 JevK5,而非 TypeSafe 官方的 Jev 模型。在该 17 个数据集的测试中,GLiNER2.5-Decide 准确率为 60.1%,JevK5 为 57.5%,SemIf 为 56.4%,GLiFormer 为 49.0%,Laya 为 46.6%。另一项针对 102 行 TypeSafe 评估子集的测试显示,Jev 的平衡准确率为 0.883,OpenJev 为 0.845。

从历史背景看,决策 Transformer 早在 2021 年就将强化学习框架化为序列建模问题。2022 年,DeepMind 发布的 Gato 模型展示了单一通用模型在多任务上的表现。2023 年的一项综述甚至将“大型决策模型”称为下一步发展方向。进入 2026 年,决策 AI 模型的包装方式发生变化,主要受四种力量驱动,推动了这一细分赛道的快速迭代。

影响分析

对于中文开发者与从业者而言,决策 AI 模型的专项化意味着开发重点需从提示词工程转向数据结构定义。由于 Jev 和 GLiDE 等模型直接返回分数或概率,开发者无需编写复杂的文本解析代码,这降低了系统集成的复杂度,但同时也要求开发者具备更强的数据建模能力。分析认为,对于高并发、低延迟的场景,如实时推荐或在线风控,GLiNER2.5-Decide 的本地部署能力(38.3 毫秒延迟)具有显著优势,尤其适合对数据隐私敏感的企业。相比之下,Jev 的云端服务和较低的输出成本适合需要快速接入且对极致延迟不敏感的业务。然而,Fastino 在测试中自行选择测试集和对手的行为,使得横向对比的可信度受到挑战。开发者在选型时,不能仅依赖厂商发布的基准测试分数,必须结合自身的实际业务场景构建独立评估集,特别是考虑到 JevK5 与官方 Jev 在性能上的潜在差异,盲目引用开源复刻版的测试数据可能会误导技术决策。

适用边界

本文关于 GLiDE 优于 Jev 的性能结论仅适用于 Fastino 自行选定的 Decision Index 0.2.1、CLadder 和 CRUXEval 测试集,以及在“Fast Decisions”测试中对比的是开源复刻版 JevK5 而非 TypeSafe 官方 Jev 模型的条件。由于 Fastino 未公开完整的测试方法论,且 Jev 官方数据中显示其在特定工作流评估中与 Sonnet 5 持平,因此不能简单推断 GLiDE 在所有决策场景下均优于 Jev。此外,GLiNER2.5-Decide 的低延迟优势基于 NVIDIA V100 环境,若在消费级硬件或不同架构的加速器上运行,其实际延迟表现可能无法复现 38.3 毫秒的指标,因此本地部署的可行性需结合实际硬件条件验证。

孤本观察

编辑观察认为,当前决策 AI 模型市场呈现出“云边协同”的竞争格局,厂商通过极短的发布周期(如 3 周)抢占特定性能指标的定义权。这是基于 Fastino 快速跟进及多模型并存的现有事实得出的判断。

常见问题

TypeSafe Jev模型输出选项数量上限及输入定价是多少?

Jev模型中的Noul原语最多支持255个选项,输入定价为每百万代币0.042美元,输出免费。

GLiNER2.5-Decide在NVIDIA V100显卡上的p50延迟是多少?

GLiNER2.5-Decide基于3.4亿参数的DeBERTa-v3-large架构,在NVIDIA V100显卡上p50延迟低至38.3毫秒。

在Fastino的“Fast Decisions”测试中,GLiNER2.5-Decide与JevK5的准确率分别是多少?

在17个数据集的测试中,GLiNER2.5-Decide准确率为60.1%,开源复刻版JevK5的准确率为57.5%。

Jev模型在匹配准确率下,其中位决策延迟较Gemini减少的比例是多少?

Jev的端到端延迟为70至500毫秒,在匹配准确率下,其中位决策延迟较Gemini减少61.9%。

对于实时推荐等低延迟场景,哪种模型更具部署优势?

GLiNER2.5-Decide的本地部署能力(38.3毫秒延迟)对数据隐私敏感的企业及实时推荐场景具有显著优势。

来源:MarkTechPost


评论