如何閱讀這一頁
以下每個資料集都是合成的,由固定種子產生。其中沒有任何真實的病患、客戶、理賠或受特權保護的資料。
這些問題刻意不是單純查詢。單表問題證明不了什麼:一個只做模式比對、沒有真正讀結構的模型也會答對。這裡每一題都需要 join,多數還需要彙總。
- 評分依據
- 與每個資料集一起保存、獨立撰寫的 SQL。代理程式看不到它,它也不是從代理程式的輸出反推而來——否則「正確」就沒有意義。
- 代管 — OpenAI
- gpt-5.6-terra — 3 次執行中,21 題裡答對 20–21 題。每次耗時 374–411 秒,中位數 403 秒。最近一次執行於 2026-08-03。 在此設定下,提示詞與查詢結果會傳送給 OpenAI。
- 代管 — DeepSeek
- deepseek-v4-flash — 3 次執行全部答對 21 題中的 21 題。每次耗時 329–591 秒,中位數 391 秒。最近一次執行於 2026-08-03。 在此設定下,提示詞與查詢結果會傳送給 DeepSeek。
- 在我們自己的硬體上
- qwen3.6:35b — 4 次執行中,21 題裡答對 20–21 題。每次耗時 215–242 秒,中位數 230 秒。最近一次執行於 2026-08-04。 沒有任何資料離開網路。
- 我們也公開失敗
- 每個模型都會評測多次,表格顯示每道題被答對的次數——因為單次執行會嚴重失真。本地模型沒有任何一道題是每次都答錯的;但有幾道它無法穩定答對,而單次執行的表格會把它們一概顯示為答錯。而且不同模型答錯的題目也不相同。
每個儲存格表示該模型的多次執行中有幾次答對了這道題。
問題以英文原文呈現,因為當時就是用英文向模型提問。在此翻譯會與實際執行的內容不符。
醫療實例實錄
不到三分鐘,從頭到尾,包含對「有什麼流出網路」的驗證。每一條指令與每一行輸出都是真的。
影片由本站自有網域提供,不是第三方嵌入——沒有第三方播放器,也沒有追蹤。
四個資料不能離開的產業
這些正是我們少有能力承接的案子:模型跑在客戶自己的硬體上,沒有任何資料到達第三方。過去這要以穩定性為代價。在現在這個模型上不再如此——本地那一欄在逐題比對上與兩個代管模型中較好的那個持平,而且比兩者都更快。
醫療機構
病歷受限,存放它們的系統位於防火牆之後,不接受連入存取。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many patients have an abnormal HbA1c and no active endocrine medication? | 11 | 3/3 · 24.3s | 3/3 · 18.4s | 4/4 · 9.8s |
| How many patients on active Warfarin have had an abnormal potassium result? | 5 | 3/3 · 16.5s | 3/3 · 16.6s | 4/4 · 9.6s |
| How many sites have four or more patients with an eGFR below 60? | 3 | 3/3 · 24.6s | 3/3 · 17.9s | 4/4 · 8.7s |
零售與商業銀行
交易監控跑在隔離網路上,客戶資料受嚴格治理。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many customers have an escalated alert with no SAR filed? | 8 | 3/3 · 15.3s | 3/3 · 19.3s | 4/4 · 8.2s |
| How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window? | 17 | 3/3 · 27.9s | 3/3 · 37.6s | 4/4 · 29.8s |
| How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)? | 3 | 3/3 · 21.6s | 3/3 · 32.4s | 4/4 · 11.2s |
財產與意外險公司
理賠檔案含有具名個人的醫療與財務細節,理賠系統只能從內部網路存取。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many claims handled by junior adjusters are litigated and still open? | 5 | 3/3 · 14.3s | 3/3 · 12.2s | 4/4 · 7.4s |
| How many open claims have total payments exceeding their reserve? | 6 | 3/3 · 19.2s | 3/3 · 40.6s | 4/4 · 9.2s |
| Which adjuster team has the highest total paid on litigated claims? | “Desk” | 3/3 · 17.2s | 3/3 · 11.4s | 4/4 · 8.6s |
企業法務部門
受特權保護的資料不只涉及政策問題,還涉及特權棄權問題,使邊界決策的後果格外重大。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many documents are past their retention date but still under an unreleased legal hold? | 45 | 3/3 · 15.7s | 3/3 · 47.5s | 4/4 · 9.1s |
| How many privileged documents belong to matters that are closed and have no unreleased hold? | 23 | 2/3 · 25.3s | 3/3 · 18.6s | 4/4 · 10.8s |
| Which practice area has the most privileged documents? | “Commercial” | 3/3 · 15.1s | 3/3 · 10.5s | 4/4 · 8.1s |
三個資料可以離開的產業
多數組織屬於這一類,而其中許多並不自覺。這些資料沒有存放地限制,因此使用已核准的代管模型是合適的——沒有需要維運的東西,不必採購硬體,上線也更快。我們會直說,而不是把你並不需要的基礎架構賣給你。
線上零售商
訂單與庫存資料沒有存放地限制,因此使用已核准的代管模型是合適的,也最省事。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many products are below their reorder point with no open purchase order? | 6 | 3/3 · 17.2s | 3/3 · 12.8s | 3/4 · 8s |
| Which category generated the most revenue from discounted orders? | “Outdoor” | 3/3 · 16.6s | 3/3 · 10.8s | 4/4 · 10.6s |
| Which supplier has the highest proportion of sold items that were returned? | “Baltic Works” | 3/3 · 19.6s | 3/3 · 14.9s | 4/4 · 14s |
B2B SaaS 業者
使用量遙測具商業敏感性,但沒有存放地限制。代管方案合適,上線也更快。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07? | 27 | 3/3 · 17.2s | 3/3 · 21.8s | 4/4 · 15s |
| How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket? | 8 | 3/3 · 24.2s | 3/3 · 37.8s | 4/4 · 16.6s |
| Which plan has the highest total monthly recurring revenue among active subscriptions? | “enterprise” | 3/3 · 12s | 3/3 · 9.9s | 4/4 · 6.1s |
地方稅務評價機關
地號、評價與成交記錄屬公開資訊。這裡沒有存放地問題可談,最能說明「AI 並非不可行」。
| 問題 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price? | 6 | 3/3 · 16.8s | 3/3 · 18.2s | 4/4 · 10.9s |
| How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026? | 4 | 3/3 · 17.6s | 3/3 · 15.3s | 4/4 · 9.8s |
| Which neighbourhood has the most pending 2026 appeals? | “Cedar Heights” | 3/3 · 17.9s | 3/3 · 12.5s | 4/4 · 7.8s |
用哪個模型由你決定,不是由我們決定
多數組織並不需要私有模型,我們會直說。如果你的政策已允許某家經核准的 AI 供應商,代管前沿模型是最省事的一條路:無需採購 GPU、無需維運,準確率如上表。對多數客戶而言,這仍然是我們的預設選擇。但在這些題目上,它並不是最快的。
我們不會做的,是假裝這個選擇沒有代價。在那種設定下,你的提示詞以及代理程式讀到的查詢結果,會依你與該供應商的合約傳送給它。對相當多的工作負載來說這完全可以接受,而且既有的供應商審查已經涵蓋。但對某些工作負載並非如此,而那正是我們少有能力處理的情形。
- 代管——我們的預設
- 沒有需要維運的東西,也不必採購硬體,按 token 計價。在這裡測量的單一設定中最準確——不過優勢很小。資料會到達模型供應商。對多數客戶在多數時候都適用。
- 在你的硬體上
- 適用於資料確實不能離開的情況。沒有資料到達第三方,硬體到位後也沒有按 token 的費用。準確率在很大程度上取決於你執行哪個開源模型:本地那一欄是一台機器上執行的 36B 混合專家模型;從 30B 的程式碼模型換成它之後,與代管模型之間的差距被完全抹平。所以教訓不是「換個更大的模型就會更好」——是哪個模型、以及它是怎麼調校的,遠比參數規模重要。
- 混合
- 部署成熟後通常是正確答案:受限資料在本地,其餘透過已核准的 API,依使用情境而非依供應商決定。
- 之後再換
- 一行設定。你不是選一次就要一直承擔,也不會因此被我們綁住。
有一項結果值得多說一句,因為它推翻了顯而易見的假設。此前的測量中,兩個代管模型都比本地模型更準確,也都更慢。我們當時把這份延遲歸因於往返次數而非模型本身——這是一個代理程式迴圈:它要發現資料庫結構、描述資料表、再執行查詢,需要多次呼叫;模型代管在外部時,每一次呼叫都要跨越公網。更換本地模型正好檢驗了這個判斷。現在這個模型在逐題比對上與兩個代管模型中較好的那個持平,回應約 230 秒,而對方是 391 秒和 403 秒。代價確實是往返。「代管就是快、本地才私密」這種說法從來都太簡化了——在這些題目上,現在本地才是更快的一方。
OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s
結果會因模型、硬體和每次執行而不同。這裡的每個模型都經過多次評測,表中給出的是這些執行的區間與中位數,而不是單次測量——但它們都在同一天完成,並且不構成保證。我們見過同一個本地模型對同一道題在一次執行中答對、在下一次中答錯,這正是表格統計執行次數而不是只給出一個結論的原因。如果你在意某個特定模型,誠實的做法是拿這些評分問題去實際測它,而不是相信網頁上的一張表——我們會和你一起,在你的資料結構上做這件事。