AIjiaU 第一栏 · 001

Jev 不写字,它做决定

TypeSafe 于 2026-09-15 发布的第一款 System One 模型。讲清它和 LLM、规则的分工,给出可粘贴的 evaluate / classifier 示例,并写明中文与繁体必须自测。

刊出 2026-09-20修订 2026-09-2022 分钟阅读

Jev 现在热,不是因为它又会聊天了。恰恰相反:它一个字都不写。

2026 年 9 月 15 日,TypeSafe AI 放出第一款公开的 System One 模型 Jev。创始人 Diogo Almeida 在发布文里把它写成一句函数调用:非结构化状态进去,带类型的概率决策出来。官方文档说得更干脆:把状态和带类型的问题交给它,直接拿到代码能分支、排序、路由的结构化答案,没有文本生成,也没有再解析一遍模型作文的步骤。

这篇文章是 AIjiaU 的旗舰栏。目标不是复述新闻稿,而是让做 Agent 和模型路由的人看完能判断:哪些缝该交给 Jev,哪些缝必须留给会写字的模型,哪些缝其实该写死规则;Vercel experimental_evaluate 和 TypeSafe noul 怎么对上;以及中文 / 繁体为什么不能直接抄英文阈值。TypeSafe 自己挂在首页上的「193.6 倍更快、444.6 倍更便宜」也必须带出处读。

它到底是什么

Jev 是 TypeSafe 的旗舰模型,也是该公司定义的 System One 类别里第一款公开产品。这个名字借自丹尼尔·卡尼曼《思考,快与慢》里的 System 1:快、窄、当场判断。它不是在声称自己像人一样直觉思考,而是在说明岗位:读当前状态,迅速给出一个被框住的答案。

按官方文档,今天的 Jev:

  • 接受文本、JSON 对象、文本数组,还不接受图像、音频、视频。
  • 用三种问题原语提问:Choice(从给定选项里选)、Score(按量尺打分)、Noul(这句话有多像真,返回 0 到 1)。
  • 同一次请求里的问题对同一份 state 并行、彼此独立评估。加问题几乎不改响应时间,也不会因为问题互相污染而「上下文腐烂」。
  • 训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),采样是并行的,不是一个 token 接一个 token 往外吐。
  • 通过 HTTP POST /v1/systemone 或官方 SDK 调用。文档示例默认模型别名是 jev-latest。

名字本身也不是空的。TypeSafe 说 Jev 取自经济学家威廉·斯坦利·杰文斯(William Stanley Jevons):蒸汽机更省煤之后,煤的总需求反而上升。他们的赌注是:决策智能一旦便宜一个数量级,会被写进多几个数量级的软件缝里。

为什么这件事现在重要

过去两年,团队把分类、分流、打分、拦工具这些活交给通用大模型,不是因为任务需要写文章,而是手里只有会写文章的模型。流程通常是:拼一段 prompt,等它逐 token 生成,再把一段自然语言解析回标签。慢、贵,还要防它写出第四个不存在的类。

Agent 把这个问题放大了。一次运行里,模型要反复回答「这个请求该走哪条模型」「这条工具调用能不能执行」「要不要重试」「结果够不够交差」。这些判断出现在热路径上。用前沿聊天模型做每一次 if,延迟和账单都会先于智能把系统拖垮。

Jev 把岗位切开:会写的模型继续写计划、写回复、写代码;决策模型只回答你事先圈定的问题。LangChain 在 2026-09-17 的说明里也是这个形状:它不是 LLM 的替换件,而是 harness 里的分类与门控层,用来做模型路由和工具前检查。

对 AIjiaU 尤其直接。api.aijiau.com 是 LLM 路由和调用网关。路由要回答的问题几乎全是 System One 形:这个请求简单还是难、该不该升级模型、要不要重试、要不要在工具执行前拦住。

2026-09-20 读取的 https://api.aijiau.com/jev 是另一套 HTML 产品页(Express 静态站,含 Playground / 文档 / curl)。人读的规范页现在是 https://www.aijiau.com/jev。机器调用不要打 /jev,打 POST /v1/systemone。模型 id 在 AIjiaU 上是 jev。

三种问题,分别什么时候用

官方原语只有三个。用错原语,比选错模型更快把系统做歪。

Choice 用来从一组无序标签里选一个。工单该去计费还是技术,请求该进哪条 Agent,该加载哪项技能。返回选中项、各选项概率和 confidence。TypeSafe 写明 Choice 基数上限是 255;选项再多,应先收窄再做第二次选择,而不是把几百个近义标签摊成一道题。

Score 用来把对象放到有序尺子上。紧急程度、检索段落够不够送进生成模型、一次 Agent 轨迹有多像失败。相邻分数是有距离的,代码可以按阈值切服务等级或人工队列。

Noul 只问一句话有多像真,返回 0 到 1 的概率。和 Choice / Score 不同,当前 Noul 响应不另给 confidence。阈值由你的代码定:改一句文案也许 0.65 就能过;动支付或删数据,0.98 加二次检查都不过分。

官方建议把大问题拆成原子问题。不要问「给这个创业 BP 打个总分」,而要分别问市场、技术可行性、差异化,再在自己的代码里加权。优先级变了,改系数,不用重写整段 prompt。

决策、生成、规则:各管哪一层

三件事常被揉成「再调一次模型」。分开写,系统才站得住。

| 缝 | 交给谁 | 为什么 | | ------------------------------------------------------------ | --------------- | -------------------------------------------- | | 答案集合事先知道,同样判断会反复出现,你能按置信采取不同动作 | Jev | 输出被 schema 框住,并行评估,概率可写进 if | | 计划、解释、用户可见回复、代码、开放抽取、多步论证 | LLM | Jev 不生成文本。只用 Jev 的 Agent 会保持沉默 | | 权限、限额、幂等、审计、合规硬闸、已知黑名单 | 规则 / 代码 | 置信不是真相,更不是授权。政策写在代码里 |

Vercel 的 Agent 控制形状和这个表一致:experimental_evaluate 问 Jev,应用代码读概率和置信再分支。清晰的工单自动进队列;部门置信低于 0.6 或选中项概率低于 0.7,就升级人工。阈值是起点,不是本栏的 SLA。

如果三件事里缺任何一件——答案集合未知、判断只做一次、你无法根据置信采取不同动作——这道缝大概不该给 Jev。若答案已经能用正则、状态机或权限表写死,也不该给 Jev。

「零幻觉」该怎么读

TypeSafe 的发布文写 Jev「can't hallucinate」,首页也用了很硬的「Zero Hallucinations」。必须把这句话拆开,否则会把它当成安全边界。

他们自己把能轻易验证的部分说清楚了:

  • 类型错误:输出形状事先定死。模型不能返回未声明字段,也不能在三个类里发明第四类。TypeSafe 称模式匹配是保证的,所以把类型幻觉画成 0%。这说的是 schema,不是语义。
  • 语义错误:仍然可能选错标签、打偏分数、读不懂绕弯的指令,或在对抗输入里变差。官方有一份 Jev 1.13 jaggedness 文档,专门写已知毛边。
  • 校准:80% 的概率在大量同类预测上大约对 80% 的次数。它不保证这一次是对的。高置信可以自动执行,低置信应升级到人或推理模型。

一句话:Jev 约束的是答卷纸的格子,不是答卷内容永远正确。把它当策略引擎的最后一道闸,是用错了。代码、权限和审计仍然要在外面。

首页上的倍数,不要当换算表

TypeSafe 目前公开的标价是:输入每百万 token 0.042 美元(也写成每十亿输入 token 42 美元),输出不计费。他们解释输出免费,是因为模型并不生成长文本。Vercel AI Gateway 上的 typesafe-ai/jev 引用的是同一张厂商标价。

速度方面,发布文写 TypeSafe 侧端到端大约 70ms 到 500ms,并称在 System One 形查询上可能比对照的前沿模型快 40 到 200 倍。官网大字 193.6× Faster, 444.6× Cheaper 来自他们发布的四条 workflow 评测里偏高的一端。公司自己加了限制条件,转述时不应丢掉:

  • 多数计时从美国西岸笔记本打到他们当前部署,不是你的机房。
  • 四条 workflow 由 TypeSafe 模型能力团队撰写;他们说不在训练集里,也不认为自己在故意讨巧,但作者身份本身就是偏差来源。
  • 对照「正确答案」是 GPT-6 Astra 与 Claude Fable 5.1 的平均,不是独立人工金标。这会偏向那两家,也可能低估 Jev 和 DeepSeek 一类模型的相对表现。
  • 对照 LLM 走的是 TypeSafe 的 System One 包装,强制输出兼容他们 API 的结构化决策;他们说这比「只要标签、不要概率」更准,但也更慢更贵。
  • 价格是否补贴,公司明确说现在证明不了,并预期长期价格往下而不是往上。

所以:这些数字可以用来理解产品形状,不能拿来做你自己账单的换算系数。外部分散证据也还薄。工程师 Malte Ubl 曾写过,他拿一份现成的、原先跑 Gemini 2.5 Flash-Lite 的分类评测去打 Jev,质量和速度都好看;那是一条预存在的评测,仍然只是单点,不是公开基准套件。

Jev 也还在 early access。发布当天是从 waitlist 往外放名额。

它在 Agent 里该坐哪

把 Agent 看成一串缝,比把它看成「一个会思考的模型」有用。

该给 Jev 的缝:答案集合事先知道;同样的判断会反复出现;你能对置信度采取不同动作。典型位置包括意图分流、选模型、选工具或技能、检索够不够用、要不要重试或停、执行前风险门、输出是否像越狱或跑题。

必须留给 LLM 的缝:计划、解释、用户可见回复、代码、开放抽取、需要跨多步论证的调查。Jev 不会写这些。只用 Jev 的 Agent 会保持沉默。

一个稳妥的双模型形状:

  1. 路由层(正是 api.aijiau.com 该做的事)用决策模型看请求难度、领域和风险,挑一个生成模型。
  2. 生成模型写计划、调工具、写回复。
  3. 工具真正执行前,再用决策模型做一次窄门:像不像用户要的,像不像危险命令,像不像该升级确认。
  4. 代码看概率和置信,决定放行、改道、重试或交给人。阈值写在你的策略里,不写在 prompt 里。
  5. 生产里钉死模型版本。发布周有文章写到别名 jev-latest 当时解析到 jev-1.13.0。别名会动;可复现的缝要钉 ID,升级时再重新校准阈值。

AIjiaU 网关已经用模型 id jev 暴露这条能力:官方协议入口是 POST https://api.aijiau.com/v1/systemone,同协议别名 POST https://api.aijiau.com/api/alpha/decisions(正文、鉴权、计费相同,新代码不必用别名)。这是 2026-09-20 从 api.aijiau.com/jev 读到的产品说明,不是本栏编造的 QPS。人读页只留 www;控制台登录和 Playground 仍在 api.aijiau.com,不要再把 /jev 当成第二套首页。

适合,和不适合

适合:工单和请求分流;检索命中打分;Agent 轨迹是否像失败;提示词 / 工具调用的快速护栏;要把非结构化状态压成特征再交给普通代码的地方。

不适合:替代 GPT / Claude / Gemini 做对话或写作;当唯一的 Agent 主模型;开放信息抽取(先让 LLM 抽字段,再交给 Jev 做是否成立的判断,往往更稳);数学证明、长程规划、需要看图看视频的任务;把置信度当成法律或合规结论。

三种调用面,不要混形状

同一份决策,至少有三条路。字段名不一样,价也不一样。

AIjiaU HTTP(本站用户):POST https://api.aijiau.com/v1/systemone,"model": "jev",问题类型是 noul / choice / score。鉴权用本站 sk-...。计价是 ¥0.6 / 1M 输入,输出免费。完整 curl 在本页下方调用面。

Vercel AI SDK(走 AI Gateway):experimental_evaluate,模型 id 是 typesafe-ai/jev。三种问题写成 choice / score / boolean。Boolean 的答案字段是 probability,不是 noul。Vercel 写明 boolean 对应 TypeSafe 的 Noul。Gateway 上引用的是 TypeSafe 的 $0.042 / 1M,不是 AIjiaU 的 ¥0.6。完整片段在本页下方动手区。

LangChain:langchain-typesafe 里的 TypeSafeClassifier。问题对象是 Choice / Score / Noul;Noul 的结果读 response.nouls["urgent"].noul。实验性 ModelRouterMiddleware 和 AutoModeMiddleware 用 Jev 选模型和拦工具。需要 TYPESAFE_API_KEY。包仍是 2026-09-17 的 alpha。

不要把 Vercel 的 boolean 写进 AIjiaU 的 JSON,也不要把 AIjiaU 的 noul 写进 evaluate()。这是最容易抄错的一行。

中文 / 繁体怎么测

TypeSafe 写明英文是主训语言,非英文(含中文)目前更弱。他们没有公布简体、繁体、粤语或中英夹杂的公开数字。所以:不要把英文阈值原样搬到中文工单上,也不要把「能跑」当成「和英文一样准」。这是 AIjiaU 愿意把旗舰栏写厚的原因——中文社区在热,官方评测几乎全是英文。

下面是自测协议,不是本栏的成绩:

  1. 先建金标,再调阈值。 至少 50 条、更好 150–200 条真实工单或对话。简体、繁体、中英夹杂分开标。标签必须是人事先定的 Choice / Score / Noul,不要事后用 LLM 给自己打分。
  2. 同一条状态,三种写法对照。 简体、台湾繁体、英文各写一遍同样的问题。记准确率、校准(高置信是否更常对)、以及失败形态:婉转、反问、成语、繁简混合、台湾用词(「伺服器」「汇款」)。
  3. 阈值按语种分开。 英文 Noul 0.80 能过的缝,中文可能要升到 0.90 再自动执行,或低置信直接升级。不要假设 confidence 的刻度跨语言可平移。
  4. zh-TW 当 CJK 测,不要当「另一个英文」。 目前没有 TypeSafe 发布的繁体专项数字。把 zh-TW / zh-HK 单独成组:正体字、台湾标点、敬语和暗示请求。
  5. 高风险缝加第二意见。 支付、删数据、对外发送,中文低置信时升级人工,或把原文译成英文再问一次,两次都过才放行。译文会丢语气,只能当辅证。
  6. 写清失败,不要写虚高。 公开只写你测过的集合大小、日期和失败例子。本栏不报准确率百分比。

ShipAny 本仓的公开语言只有 zh + en。繁体测试指南写在中文栏里,并不等于我们另开了一套 zh-TW 站点。

开源仿品不是 Jev

发布后很快出现社区站点 jevai.dev(解释页,带 OpenRouter 示例,不是 TypeSafe 官网),以及 jevlike、OpenJev、NanoJev 一类开源复刻。它们是研究起点,不是 Jev。不要假设它们有同样的校准、同样的 jaggedness 文档、或同样的 schema 保证。生产决策层要么打 TypeSafe / AIjiaU 的 jev,要么把开源复刻当成你自己要评测的另一个模型。

Jev 仍在 early access。置信不是真相。开源克隆的存在,不降低官方模型的责任,也不构成「大家都一样」的借口。

在 AIjiaU 上怎么调用

下面调用面从 2026-09-20 的 api.aijiau.com/jev 与 /jev/docs 并入,避免两套首页。要点只复述现网已经写明的部分:

  • 鉴权:已登录会话,或本站 sk-...。不要用站外 / 上游密钥。
  • 公开模型 id:jev。
  • 计费:输入 ¥0.6 / 1M tokens,输出免费。这是 AIjiaU 对用户展示的价,不是 TypeSafe 的 $0.042 / MTok。
  • 文本为主。官方模型卡把预算写成整次请求约 64k tokens,更紧的闸是 state + 最长问题约 32k。
  • 英文是主训语言,中文能跑,但准确率目前较低。上线前用自己的语料看 confidence,不要假设和英文一样准。
  • 他们的文档给过 answers 形状示例,并写明那些数字是说明用,不是对本站实时模型的承诺。

完整 curl 和步骤见本页下方调用面。试跑走 Playground,不要再打开 api.aijiau.com/jev。

你现在可以做什么

  1. 先读 TypeSafe 的发布文和文档导言,用他们的原语而不是「再包一层 JSON mode」去想问题。
  2. 在自己的 Agent 里标出决策缝:路由、选工具、停 / 重试、执行前检查。把开放写作留下给 LLM。规则能写死的,不要交给任何模型。
  3. 用 AIjiaU 的 sk-... 打 POST /v1/systemone,模型填 jev。若走 Vercel Gateway,用 experimental_evaluate 和 typesafe-ai/jev,记住 boolean ≠ noul。
  4. 用自己的中文 / 繁体金标测一遍,再定阈值。不要抄英文 cutoff。
  5. 人读只留 www.aijiau.com/jev。要选聊天模型而不是决策模型时,再走 api.aijiau.com 控制台。合作写 ming@aijiau.com。

后续文档和博客会按专栏同样的规则加:有完整中英稿再上,不放空壳。

材料来源

TypeSafe 的速度、价格和倍数是厂商数字。AIjiaU 的 ¥0.6 / 1M 与模型 id jev 来自其现网产品页。两者不要混成一张价目表。若任一方文档更新,以该方为准。

动手

先选岗位,再粘贴调用。

Jev 做已知集合上的反复判断。LLM 写计划、回复和代码。权限和审计写在规则里。下面片段来自 Vercel 与 LangChain 文档,不是本栏编造的 API。

Jev

答案集合已知、判断会反复出现、你能按置信采取不同动作。输出是 Choice / Score / Noul 加概率。

LLM

计划、解释、用户可见回复、代码、开放抽取。Jev 不写这些。

Rules

权限、限额、幂等、审计、已知黑名单。置信不是授权。

Vercel AI SDK:experimental_evaluate

模型 id 是 typesafe-ai/jev,走 AI Gateway。这里的 boolean 对应 TypeSafe Noul,答案字段是 probability。Gateway 引用 TypeSafe 的 $0.042 / 1M,不是 AIjiaU 的 ¥0.6。

TypeScript · experimental_evaluate · typesafe-ai/jev

import { experimental_evaluate as evaluate } from 'ai';

export async function triageTicket(ticket: {
  subject: string;
  message: string;
}) {
  const result = await evaluate({
    model: 'typesafe-ai/jev',
    state: ticket,
    questions: {
      department: {
        type: 'choice',
        instructions: 'Which team should handle this ticket?',
        criteria: {
          billing: 'Charges, invoices, and refunds',
          technical: 'Bugs, outages, and integration failures',
          account: 'Login, permissions, and profile changes',
        },
      },
      urgent: {
        type: 'boolean',
        instructions: 'Does this need attention now?',
      },
    },
  });

  return {
    queue: result.answers.department.choice,
    urgent: result.answers.urgent.probability >= 0.8,
  };
}

LangChain:TypeSafeClassifier

langchain-typesafe 仍是 2026-09-17 的 alpha。Noul 读 response.nouls[...].noul。ModelRouterMiddleware 是实验 API,可能改。需要 TYPESAFE_API_KEY。

Python · langchain-typesafe · TypeSafeClassifier

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "The deploy failed twice and customers are seeing 500s. "
        "Can someone look now?"
    ),
    questions={
        "urgent": Noul(
            instructions="Does this need attention right now?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Python · experimental ModelRouterMiddleware

from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import (
    ModelChoice,
    ModelRouterMiddleware,
)

router = ModelRouterMiddleware(
    choices={
        "fast": ModelChoice(
            model="openai:luna",
            criteria="Direct lookups, extraction, and localized changes.",
        ),
        "powerful": ModelChoice(
            model="openai:sol",
            criteria="Architecture and high-stakes decisions.",
        ),
    },
    instructions="Choose the least costly model that can complete the task.",
)

agent = create_agent("openai:gpt-5.6-luna", middleware=[router])

在 AIjiaU 调用

用本站密钥打 Jev

以下内容并自 2026-09-20 的 api.aijiau.com/jev。鉴权用已登录会话或本站 sk-...。公开模型 id 为 jev。新代码走 POST /v1/systemone。

模型 id
jev
AIjiaU 计价
输入 ¥0.6 / 1M · 输出免费

这是 AIjiaU 对用户展示的价,不是 TypeSafe 上游标价。

官方协议入口
POST https://api.aijiau.com/v1/systemone
同协议别名
POST https://api.aijiau.com/api/alpha/decisions

正文、鉴权、计费相同。新代码不必用别名。

curl · POST /v1/systemone

# 把 sk-... 换成你在 AIjiaU「API 密钥」里创建的密钥
curl -sS -X POST https://api.aijiau.com/v1/systemone \
  -H "Authorization: Bearer sk-你的AIjiaU密钥" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "jev",
    "state": "用户反馈:付款已经失败三天,订单 ORD-2024-1234,金额 $299,急需处理。",
    "questions": {
      "urgent": {
        "type": "noul",
        "instructions": "这个问题是否紧急?"
      },
      "team": {
        "type": "choice",
        "instructions": "应该由哪个团队处理?",
        "criteria": {
          "billing": "支付、退款、账单",
          "technical": "技术故障、API 错误",
          "sales": "销售咨询、价格"
        }
      },
      "frustration": {
        "type": "score",
        "instructions": "用户沮丧程度",
        "criteria": ["平静", "有些不满", "非常愤怒"]
      }
    }
  }'

示例请求来自 api.aijiau.com/jev 现网,不是本栏编造的工单。

  1. 打开 api.aijiau.com 登录。试跑用控制台 Playground,走当前会话,不必把密钥贴进页面。
  2. 程序调用到「API 密钥」创建 sk-...,请求头带 Authorization: Bearer sk-...。
  3. POST https://api.aijiau.com/v1/systemone,body 里 model 填 jev,带上 state 和 questions。
  4. 用 answers 写普通 if。Noul 对阈值,Choice 对分支,Score 对档位。confidence 低就升级人工。

联系

邮箱全球可用,微信给中文用户。

公开客服只有这两条:ming@aijiau.com,以及微信卡「爱嘉智能客服」。不要再找其他频道。

邮箱

ming@aijiau.com

全球默认渠道。路由、专栏、合作都写这里。

写信给 ming@aijiau.com
爱嘉智能客服。扫二维码,添加我为朋友。

爱嘉智能客服

扫二维码,添加我为朋友。

微信主要给中文用户。说明原文:扫二维码,添加我为朋友。

爱嘉智能客服。扫二维码,添加我为朋友。

爱嘉智能客服扫二维码,添加我为朋友。