ChatGPTの土台になった学習手法RLHF(人の評価をもとにAIの答え方を学習させる手法)を発明した研究者が、新しい会社から、文章を返さないAIを出しました。名前はJev。状態と質問を渡すと、選択肢ごとの確率だけが返ります。当社はサポートチャットの「人に回すか」の判断で、Claude Haiku 4.5と並べて50件を通しました。
① 事実
TypeSafe AIという米国の新会社が、9月15日にJevというモデルの早期アクセスを始めました。文章を生成せず、渡された状態について、こちらが決めた選択肢の中から確率つきで答えを返すモデルです。値段は入力だけで、出力は無料。提供元は同時に、このモデルの苦手を9つ挙げた文書を公開しています。外部の検証も出始めていて、質問の割り方で正解率が大きく動くと報告されています。会社と仕組みと値段を先に、提供元の自己申告と外部の検証をあとに置きます。
TypeSafe AIは9月15日、「文章を返さないAI」Jevの早期アクセスを始めました
TypeSafe AIは2024年創業、CEOは元OpenAIのDiogo Almeidaです。ChatGPTの開発に加わり、RLHFを発明した一人と紹介されています。約2年の非公開期間を経て、2026年9月に表に出ました。調達額は4,000万ドルと報じられています。
9月15日に早期アクセスを始め、待機リストから順に招待しています。同社はJevを「System One モデル」と呼び、「ソフトウェアが直接使える、速くて構造化された判断を下すために作った、新しい種類のモデル」と説明しています。
Jevは状態と質問を受け取り、選択肢ごとの確率を返します
使い方は、状態(判断してほしい対象の文章や項目)と質問を一緒に送る形です。質問は3種類あります。Choice(選択肢から一つ選ぶ)、Score(段階で評価する)、Noul(はい・いいえの確率を0〜1で返す)。答えはこちらが決めた型の中に収まり、選択肢ごとの確率が付きます。
一つの状態に対して、複数の質問を一度に送れます。提供元の文書は「質問を足しても応答時間はほとんど変わらない」「必要ないかもしれない質問を訊くのは、ほぼ無料」と書いています。選択肢の並べ方については「一覧が全部の入力を覆えないかもしれないときは、『その他』か『どれでもない』の選択肢を足す」よう勧めています。
学習の方法は、同社がRLCD(Reinforcement Learning for Calibrated Decisions=答えの確からしさを正直に出すよう強化学習する手法)と呼ぶものです。発表文は「型の外の答えや、事実でないことを事実のように出力することは、構造上できない」と書いています。答えの形が壊れないという意味であり、判断そのものが間違う可能性は残ります。この点は、提供元の別の文書(後述)が自分で書いています。
入力は文章だけで、画像・音声・動画は受け付けません。1リクエストで6万4,000トークン(AIが文章を扱う単位)まで、状態と一番長い質問で3万2,000トークンまで。主な学習言語は英語で、日本語を含むCJK(中国語・日本語・韓国語)の文字は「受け付けるが、同じ精度ではない。自分の内容で試してから頼ること」と書かれています。
値段は入力10億トークンで42ドル、出力は無料です
料金は100万トークンあたり0.042ドル、10億トークンで42ドル。出力トークンは無料です。OpenAIのGPT-5.6 Luna(入力0.20ドル)の約5分の1です。上限は毎秒25万トークン、毎分1,200リクエスト。
速さについて、発表文は応答70〜500ミリ秒(比較したLLMは3〜329秒)と書いています。The Registerが報じたデモでは、ゲーム「Doom」の状態を渡して次の動作を決めさせ、Jevが0.114秒、GPT-5.6 Terraが8.566秒でした。数字は提供元のものです。
提供元は、Jevの苦手を9つ挙げた文書を公開しています
docs.typesafe.aiに「Jev 1.13 jaggedness」(凸凹=得手不得手のむら)という文書があります(2026年9月17日確認版)。冒頭は「Jevは完璧ではない」。苦手として9つ=字義どおりの読み/計算と数/日付の比較/間接的な指示/無関係な情報の多い状態/敵対的な内容/矛盾する指示/構造上の当たり前/文章の生成。
字義どおりの読みについての原文は、こうです。「書かれた質問に答える。意図した質問には答えない」。範囲を限る言葉、否定、暗黙の条件は、字面のまま読まれます。「間違った答えを見て、本当はこういう意味だったと説明している自分に気づいたら、その説明が指示の欠けていた半分です」。
状態については「判断に関係のない内容で状態が大きくなるほど、精度が下がる」。敵対的な内容については「正確な指示を書き、配備の前に端の事例を試すこと」。計算と数は「Jevは計算機ではない。数学的な処理はコードで実装することを強く勧める」。
外部の検証は、質問を1つから5つに割ると62.6%が95%になったと報告しています
独立の書き手Rajesh Beri氏が9月20日に公開した検証記事は、フィッシングメール2,000件の公開データで測っています。「これはフィッシングか」と1問で訊いたときの正解率が62.6%。リンクの短縮の有無、無料ホスティングの使用、無料メールアドレスで組織を名乗っているか、など5つの小さな質問に割り、その答えを1,000件でロジスティック回帰(複数の信号を重みづけして一つの判定にまとめる統計手法)に当てはめ、残りの1,000件で測ると95.0%でした。
同氏は「95%はJevではない。Jevと、あなたのラベル付きデータと、あなたが保守する回帰だ」と書いています。そのうえで、本番の判断を一つでも動かす前に、自社のラベル付きの判断ログで、本番と並走させて答えだけを記録する評価をすることを勧めています。
データは学習に使わず、保持期間は「必要な間」、ゼロ保持は企業契約です
プライバシーポリシーは「プロンプトやその他の入力で、AIや機械学習のモデルを訓練・微調整しない」「入力を、サービス提供者以外の第三者に開示しない」と書いています。保持期間は「サービスの提供に合理的に必要な間」で、日数の明記はありません。法務のページに「企業顧客にはゼロデータ保持(ZDR)も提供している」とあります。
コンソールは9月20日に44分、21日に23分落ちています
ステータスページによると、開発者コンソールが9月20日に44分、21日に23分、APIが9月19日に18分停止しました。9月21日午前(協定世界時)の時点で「一部停止中」の表示でした。当社も21日、ログインの画面で502エラーを何度か受けています。
出典:
- TypeSafe AI「Introducing System One Models and Jev」 https://typesafe.ai/blog/introducing-system-one-models-and-jev
- TypeSafe AI Docs「Models」(Jev 1.13・価格・上限・言語) https://docs.typesafe.ai/models
- TypeSafe AI Docs「Primitives (Questions)」 https://docs.typesafe.ai/primitives
- TypeSafe AI Docs「Jev 1.13 jaggedness」(2026年9月17日確認版) https://docs.typesafe.ai/model-jaggedness/jev-1.13
- TypeSafe AI「Privacy Policy」/「Legal」 https://typesafe.ai/legal/privacy-policy / https://docs.typesafe.ai/legal
- TypeSafe AI Status https://status.typesafe.ai/
- The Register「TypeSafe AI debuts model for machines that plays Doom」(2026年9月16日) https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711
- TechCrunch「A new kind of AI model from a ChatGPT inventor is thrilling developers」(2026年9月18日) https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
- Rajesh Beri「TypeSafe's Jev Scores 62.6% Asked Once and 95% Split Five Ways」(2026年9月20日) https://www.beri.net/article/typesafe-jev-typed-decision-model-calibration-decomposition-shadow-eval
② 構造
文章を返すAIが一台あれば何でもできる、という形から、判断だけを返す部品が分かれて出てきました。分かれたことで値段が桁で下がり、置ける場所が変わります。提供元と外部の検証は、正解率を決めているのは何を渡してどう訊くかの側だ、と同じことを書いています。当社の実測も、同じところに落ちました。
万能の一台の隣に、判断だけの部品が置かれました
計算機では、何でもできるCPUの隣に、行列計算だけをするGPUが置かれ、いまのAIはそのGPUの上で動いています。用途を一つに絞った部品は、万能の一台より速く、安く、その用途では正確です。Jevは、判断の分野でその位置に置かれたものだと読めます。文章を生成せず、確率だけを返す。生成が要る場面は、別のモデルに回します。
RLHFを発明した本人が、文章を返さないモデルを出したところに、この分化が読み取れます。ChatGPTは万能の一台の側でした。同じ人が、その隣の部品を作りました。
原価が桁で下がると、置ける場所が変わります
当社の実測で、1件の判断の原価はHaiku 4.5で約0.0017ドル、Jevで約0.0004ドルでした。時間は1,504ミリ秒と291ミリ秒です。差は4倍と5倍で、どちらも同じ50件で100%を出しています。
この差で変わるのは、正解率より置き場所です。LLMで1回1.5秒・0.0017ドルの判断は、会話の1ターンに1回が限度でした。0.3秒・0.0004ドルなら、1ターンに3回叩けます。検索で出てきた資料3件を「この資料はこの質問に答えているか」と1件ずつ訊く、という使い方が、初めて現実的になります。値段が下がると、同じことが安くなります。加えて、やらなかったことができるようになります(Vol.39)。
正解率を決めているのは、渡し方の側です
提供元の「凸凹」の文書は、間違った答えを見て「本当はこういう意味だった」と説明している自分に気づいたら、その説明が指示の欠けていた半分だ、と書いています。外部の検証は、1問で62.6%、5問に割って回帰を足すと95%で、「95%はJevではない」と書いています。
二つの文書は、別の言い方で同じことを言っています。モデルの正解率は、モデルに固定された数字としては存在しません。何を状態に入れ、質問をいくつに割り、どの選択肢を置き、どう言い回すかで動く。動かしているのは、使う側が書いたものです。
当社の実測では、同じ直しがJevにもHaikuにも効きました。この形が成り立つなら、資産は渡し方の側にあり、モデルは差し替えられる部品です。50件の実測で言えるのは、そこまでです。