跳至主要內容
Last Furlong
語言: 繁體中文

實測

七個實例,全部評分。

每個問題都需要跨表 join 與彙總,而代理程式事先並未取得資料庫結構。答案對照獨立撰寫的 SQL 檢核,因此「正確」代表它是自己得出來的。

如何閱讀這一頁

以下每個資料集都是合成的,由固定種子產生。其中沒有任何真實的病患、客戶、理賠或受特權保護的資料。

這些問題刻意不是單純查詢。單表問題證明不了什麼:一個只做模式比對、沒有真正讀結構的模型也會答對。這裡每一題都需要 join,多數還需要彙總。

評分依據
與每個資料集一起保存、獨立撰寫的 SQL。代理程式看不到它,它也不是從代理程式的輸出反推而來——否則「正確」就沒有意義。
代管 — OpenAI
gpt-5.6-terra — 3 次執行中,21 題裡答對 20–21 題。每次耗時 374–411 秒,中位數 403 秒。最近一次執行於 2026-08-03。 在此設定下,提示詞與查詢結果會傳送給 OpenAI。
代管 — DeepSeek
deepseek-v4-flash — 3 次執行全部答對 21 題中的 21 題。每次耗時 329–591 秒,中位數 391 秒。最近一次執行於 2026-08-03。 在此設定下,提示詞與查詢結果會傳送給 DeepSeek。
在我們自己的硬體上
qwen3.6:35b — 4 次執行中,21 題裡答對 20–21 題。每次耗時 215–242 秒,中位數 230 秒。最近一次執行於 2026-08-04。 沒有任何資料離開網路。
我們也公開失敗
每個模型都會評測多次,表格顯示每道題被答對的次數——因為單次執行會嚴重失真。本地模型沒有任何一道題是每次都答錯的;但有幾道它無法穩定答對,而單次執行的表格會把它們一概顯示為答錯。而且不同模型答錯的題目也不相同。

每個儲存格表示該模型的多次執行中有幾次答對了這道題。

問題以英文原文呈現,因為當時就是用英文向模型提問。在此翻譯會與實際執行的內容不符。

醫療實例實錄

不到三分鐘,從頭到尾,包含對「有什麼流出網路」的驗證。每一條指令與每一行輸出都是真的。

影片由本站自有網域提供,不是第三方嵌入——沒有第三方播放器,也沒有追蹤。

四個資料不能離開的產業

這些正是我們少有能力承接的案子:模型跑在客戶自己的硬體上,沒有任何資料到達第三方。過去這要以穩定性為代價。在現在這個模型上不再如此——本地那一欄在逐題比對上與兩個代管模型中較好的那個持平,而且比兩者都更快。

醫療機構

病歷受限,存放它們的系統位於防火牆之後,不接受連入存取。

問題答案OpenAIDeepSeekLocal
How many patients have an abnormal HbA1c and no active endocrine medication?113/3 · 24.3s3/3 · 18.4s4/4 · 9.8s
How many patients on active Warfarin have had an abnormal potassium result?53/3 · 16.5s3/3 · 16.6s4/4 · 9.6s
How many sites have four or more patients with an eGFR below 60?33/3 · 24.6s3/3 · 17.9s4/4 · 8.7s

零售與商業銀行

交易監控跑在隔離網路上,客戶資料受嚴格治理。

問題答案OpenAIDeepSeekLocal
How many customers have an escalated alert with no SAR filed?83/3 · 15.3s3/3 · 19.3s4/4 · 8.2s
How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window?173/3 · 27.9s3/3 · 37.6s4/4 · 29.8s
How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)?33/3 · 21.6s3/3 · 32.4s4/4 · 11.2s

財產與意外險公司

理賠檔案含有具名個人的醫療與財務細節,理賠系統只能從內部網路存取。

問題答案OpenAIDeepSeekLocal
How many claims handled by junior adjusters are litigated and still open?53/3 · 14.3s3/3 · 12.2s4/4 · 7.4s
How many open claims have total payments exceeding their reserve?63/3 · 19.2s3/3 · 40.6s4/4 · 9.2s
Which adjuster team has the highest total paid on litigated claims?“Desk”3/3 · 17.2s3/3 · 11.4s4/4 · 8.6s

企業法務部門

受特權保護的資料不只涉及政策問題,還涉及特權棄權問題,使邊界決策的後果格外重大。

問題答案OpenAIDeepSeekLocal
How many documents are past their retention date but still under an unreleased legal hold?453/3 · 15.7s3/3 · 47.5s4/4 · 9.1s
How many privileged documents belong to matters that are closed and have no unreleased hold?232/3 · 25.3s3/3 · 18.6s4/4 · 10.8s
Which practice area has the most privileged documents?“Commercial”3/3 · 15.1s3/3 · 10.5s4/4 · 8.1s

三個資料可以離開的產業

多數組織屬於這一類,而其中許多並不自覺。這些資料沒有存放地限制,因此使用已核准的代管模型是合適的——沒有需要維運的東西,不必採購硬體,上線也更快。我們會直說,而不是把你並不需要的基礎架構賣給你。

線上零售商

訂單與庫存資料沒有存放地限制,因此使用已核准的代管模型是合適的,也最省事。

問題答案OpenAIDeepSeekLocal
How many products are below their reorder point with no open purchase order?63/3 · 17.2s3/3 · 12.8s3/4 · 8s
Which category generated the most revenue from discounted orders?“Outdoor”3/3 · 16.6s3/3 · 10.8s4/4 · 10.6s
Which supplier has the highest proportion of sold items that were returned?“Baltic Works”3/3 · 19.6s3/3 · 14.9s4/4 · 14s

B2B SaaS 業者

使用量遙測具商業敏感性,但沒有存放地限制。代管方案合適,上線也更快。

問題答案OpenAIDeepSeekLocal
Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07?273/3 · 17.2s3/3 · 21.8s4/4 · 15s
How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket?83/3 · 24.2s3/3 · 37.8s4/4 · 16.6s
Which plan has the highest total monthly recurring revenue among active subscriptions?“enterprise”3/3 · 12s3/3 · 9.9s4/4 · 6.1s

地方稅務評價機關

地號、評價與成交記錄屬公開資訊。這裡沒有存放地問題可談,最能說明「AI 並非不可行」。

問題答案OpenAIDeepSeekLocal
How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price?63/3 · 16.8s3/3 · 18.2s4/4 · 10.9s
How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026?43/3 · 17.6s3/3 · 15.3s4/4 · 9.8s
Which neighbourhood has the most pending 2026 appeals?“Cedar Heights”3/3 · 17.9s3/3 · 12.5s4/4 · 7.8s

用哪個模型由你決定,不是由我們決定

多數組織並不需要私有模型,我們會直說。如果你的政策已允許某家經核准的 AI 供應商,代管前沿模型是最省事的一條路:無需採購 GPU、無需維運,準確率如上表。對多數客戶而言,這仍然是我們的預設選擇。但在這些題目上,它並不是最快的。

我們不會做的,是假裝這個選擇沒有代價。在那種設定下,你的提示詞以及代理程式讀到的查詢結果,會依你與該供應商的合約傳送給它。對相當多的工作負載來說這完全可以接受,而且既有的供應商審查已經涵蓋。但對某些工作負載並非如此,而那正是我們少有能力處理的情形。

代管——我們的預設
沒有需要維運的東西,也不必採購硬體,按 token 計價。在這裡測量的單一設定中最準確——不過優勢很小。資料會到達模型供應商。對多數客戶在多數時候都適用。
在你的硬體上
適用於資料確實不能離開的情況。沒有資料到達第三方,硬體到位後也沒有按 token 的費用。準確率在很大程度上取決於你執行哪個開源模型:本地那一欄是一台機器上執行的 36B 混合專家模型;從 30B 的程式碼模型換成它之後,與代管模型之間的差距被完全抹平。所以教訓不是「換個更大的模型就會更好」——是哪個模型、以及它是怎麼調校的,遠比參數規模重要。
混合
部署成熟後通常是正確答案:受限資料在本地,其餘透過已核准的 API,依使用情境而非依供應商決定。
之後再換
一行設定。你不是選一次就要一直承擔,也不會因此被我們綁住。

有一項結果值得多說一句,因為它推翻了顯而易見的假設。此前的測量中,兩個代管模型都比本地模型更準確,也都更慢。我們當時把這份延遲歸因於往返次數而非模型本身——這是一個代理程式迴圈:它要發現資料庫結構、描述資料表、再執行查詢,需要多次呼叫;模型代管在外部時,每一次呼叫都要跨越公網。更換本地模型正好檢驗了這個判斷。現在這個模型在逐題比對上與兩個代管模型中較好的那個持平,回應約 230 秒,而對方是 391 秒和 403 秒。代價確實是往返。「代管就是快、本地才私密」這種說法從來都太簡化了——在這些題目上,現在本地才是更快的一方。

OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s

結果會因模型、硬體和每次執行而不同。這裡的每個模型都經過多次評測,表中給出的是這些執行的區間與中位數,而不是單次測量——但它們都在同一天完成,並且不構成保證。我們見過同一個本地模型對同一道題在一次執行中答對、在下一次中答錯,這正是表格統計執行次數而不是只給出一個結論的原因。如果你在意某個特定模型,誠實的做法是拿這些評分問題去實際測它,而不是相信網頁上的一張表——我們會和你一起,在你的資料結構上做這件事。

終點

想在你自己的資料結構上跑一遍嗎?

「評估」的起點,是確認你的資料實際上允許什麼——那往往比大家以為的寬鬆。帶上一個資料結構,和一個你現在答不出來的問題。