

九月中有個新東西叫 Jev,在工程圈討論度不低。它跟 ChatGPT 那類 AI 不一樣:你問它問題,它不會寫一段話給你,只會回答「是哪一個」、「幾分」、「是或不是」,再附上一個信心程度。聽起來功能變少了,但這正是它快和便宜的原因。
它到底是什麼
Jev 是美國舊金山一家叫 TypeSafe AI 的公司做的模型,9 月 15 日開放限量試用。這家公司 2024 年才成立,執行長 Diogo Almeida 之前在 OpenAI 待過四年。
他們把 Jev 叫做「System One 模型」,意思大概是:人的思考分成直覺反應和慢慢推理兩種,Jev 只做前者。它不會寫文章、不會跟你聊天,就是專門用來下判斷的。
實際上它只接三種題型:
- 選擇題:從你給的幾個選項裡挑一個。例如這封詢價信該轉給業務、工程還是售後。
- 評分題:在有高低刻度的尺上給分。例如這件客訴的急迫程度是低、中還是高。
- 是非題:回答某件事成立的機率。例如這張發票的金額欄位是不是填錯了。
三種題型都可以一次問好幾題,而且它會同時處理,不是一題一題排隊。回傳的答案一定落在你事先定好的選項裡,附一個 0 到 1 的信心值。它不可能回一個你沒定義過的答案——這是它最實用的一點,後面會講為什麼。
快和便宜到什麼程度
TypeSafe 自己的說法是,做同樣的判斷工作,Jev 比第一線的大模型快 40 到 200 倍、便宜 40 到 400 倍。《Tom’s Hardware》報導時引用的數字更誇張,說對上 GPT-6 Astra 是快 193 倍、便宜 445 倍。
這些數字要打折看。TypeSafe 自己就承認,這些是內部測出來的,而且大概是最好的那一端。他們到目前也沒有公開技術論文或模型權重,所以外面沒辦法獨立驗證。
比較實在的是掛牌價格。在 OpenRouter 上,Jev 的輸入是每一百萬 token(可以粗略想成一百多萬個字)美金 0.042 元,輸出免費。這個價格低到一個程度:如果照日本一家公司實測的用量(每件判斷約 1,100 token)來推算,做一萬次判斷的模型費用大概是新台幣十幾塊。
當然這只是模型費。真正的成本在工程時間——設計題目、接系統、驗證準確度,這些才是主要支出。
它不能做什麼(這段比較重要)
看到「快 200 倍、便宜 400 倍」很容易腦補成它什麼都能做,但限制其實不少:
- 不會生成文字。客服回覆、報價說明、文案,它一句都寫不出來。
- 沒有記憶,也沒有外部知識。它只根據你這一次餵給它的資料判斷,不會去查網路、也不記得上次聊過什麼。
- 資料塞太多反而更不準。它的容量上限是三萬兩千個 token 左右,但不是塞到滿最好——把不相關的資料一起丟進去,準確率會掉。
- 只吃文字,圖片和語音都不行。
- 中文準確度低於英文。這點對台灣公司影響直接,得自己實測,不能看官方數字就算。
- 複雜數學、多步推理這類要慢慢想的事,它不擅長。
所以它不是用來取代 ChatGPT 的,而是分工:開放性的、要寫東西的交給大模型,路上那些「這件事該往左還往右」的判斷交給 Jev。
別人的實測長什麼樣子
日本一家叫 KOIYAL 的公司寫了他們的導入過程,我覺得是目前看到最務實的參考。
他們原本每週要人工把微軟和 Google 的官方更新分成四類:對客戶有立即影響、可以當教材、可以發社群、跳過。這件事很花時間但判斷邏輯固定,正好是 Jev 的場景。
他們測了 8 篇,跟人工判斷比對,7 篇一致、1 篇不一樣。有意思的是不一致的那篇原因不在模型——是他們自己的題目沒把判斷標準寫清楚,漏掉一個關於課程難度的條件。反應時間每篇 0.45 到 0.75 秒,信心值大多落在 0.82 以上。
更值得抄的是他們的做法:不直接換掉人工,而是先讓 Jev 跟人平行跑一段時間,累積一致率,等一週一致率超過九成才把第一層判斷交給它。同時設信心門檻,信心值不夠高的案子自動退回給人看。
對中小企業來說,該怎麼評估
先說結論:現階段不用急著導入,但值得知道它存在,因為它適合的場景在很多公司都有。
先找出「量大、規則固定、但現在靠人眼看」的流程。這是判斷適不適合的第一關。像是把進來的詢問分派到不同部門、把客訴按急迫度排序、判斷一張單據的欄位有沒有明顯錯誤、從一堆履歷裡先篩掉完全不符條件的。共同點是:答案就在幾個固定選項裡,而且一天要做很多次。
反過來說,一天只做三次的判斷不值得動工。接系統、寫題目、驗證的工程成本是固定的,量不夠大就攤不回來。這種情況你請一個工讀生看,或直接用現成的大模型偶爾跑一下,都比較划算。
要問清楚的第二件事是:判斷錯了會怎樣。我們之前在講 AI 導入時提過一個經驗——我們開發給法律事務所用的工具裡,AI 整理判決書時偶爾會很有自信地寫出不存在的法條,後來加了一層自動查核,有疑慮的標紅色,最後由人確認。Jev 的設計對這個問題幫助很大,因為它的答案一定落在你定好的選項內,不會生出你沒預期的東西。但「格式一定對」不等於「判斷一定對」——它照樣會分錯類。所以出錯代價高的地方,人工複核那一關不能省。
第三件事是資料。TypeSafe 的條款寫明,未經同意不會把你的輸入拿去訓練模型;企業客戶可以另外談「不留存資料」的合約;他們也有 SOC 2 Type II(一種資安管理的第三方查核報告)。但資料是在美國的機房處理,預設保留多久官方文件沒有寫清楚,要直接問他們。如果你要送進去的是客戶名單或報價資料,這些得先確認。
還有一個風險要誠實講:這是一家成立兩年的新公司,產品九月才開放,沒有公開論文,也還沒有長期穩定性的紀錄。把關鍵流程押在上面,現在還太早。比較合理的做法是拿一個不痛不癢的流程試,而且從頭就保留隨時換回去的空間。
所以現在該做什麼
如果你公司有那種「每天要判斷幾百次、規則其實寫得出來」的工作,可以先做一件不花錢的事:把判斷標準寫下來。寫成幾個明確的選項,每個選項的條件是什麼。
這件事本身就有價值——KOIYAL 那個唯一判斷錯的案例,問題就出在標準沒寫清楚。而且標準一旦寫清楚,你會發現有些流程根本不需要 AI,寫幾條規則就解決了。真的需要 AI 判斷的,到時候不管用 Jev 還是別的,題目都已經準備好了。
我們自己還沒在正式專案裡用 Jev,目前是在看它的穩定度和中文表現。如果你手上有流程不確定適不適合,歡迎找我們聊,先評估值不值得動工再說。
資料來源
- Jev (AI model) — Wikipedia:公司背景、架構與官方效能聲明
- Tom’s Hardware:效能倍數與限制
- OpenRouter:掛牌價格與上下文長度
- Cloudflare AI Docs:三種題型與規格
- KOIYAL:平行運轉實測與導入步驟
- Zenn:企業使用條款、資料保存與資安查核

