如何阅读本页
以下每个数据集都是合成的,由固定随机种子生成。其中没有任何真实的患者、客户、理赔或受特权保护的资料。
这些问题有意不是简单查询。单表问题证明不了什么:一个靠模式匹配而非真正读取结构的模型也能答对。这里每一个都需要连接,多数还需要聚合。
- 评分依据
- 与每个数据集一同保存的、独立编写的 SQL。智能体从不看到它,而它也不是从智能体的输出反推而来——否则「通过」就毫无意义。
- 托管 — OpenAI
- gpt-5.6-terra — 3 次运行中,21 题里答对 20–21 题。每次耗时 374–411 秒,中位数 403 秒。最近一次运行于 2026-08-03。 在此配置下,提示词与查询结果会发送给 OpenAI。
- 托管 — DeepSeek
- deepseek-v4-flash — 3 次运行全部答对 21 题中的 21 题。每次耗时 329–591 秒,中位数 391 秒。最近一次运行于 2026-08-03。 在此配置下,提示词与查询结果会发送给 DeepSeek。
- 在我们自己的硬件上
- qwen3.6:35b — 4 次运行中,21 题里答对 20–21 题。每次耗时 215–242 秒,中位数 230 秒。最近一次运行于 2026-08-04。 没有任何数据离开网络。
- 我们公开失败结果
- 每个模型都会评测多次,表格显示每道题被答对的次数——因为单次运行会严重失真。本地模型没有任何一道题是每次都答错的;但有几道它无法稳定答对,而单次运行的表格会把它们一概显示为答错。而且不同模型答错的题目也不相同。
每个单元格表示该模型的多次运行中有几次答对了这道题。
问题以英文原文呈现,因为模型当时就是用英文提问的。在此处翻译问题会与实际运行内容不符。
医疗案例实录
不到三分钟,端到端,包含对「有什么流出网络」的核验。每一条命令与每一行输出都是真实的。
视频由本站自有域名提供,不是第三方嵌入——没有第三方播放器,也没有追踪。
四个数据不能离开的行业
这些正是我们少有能力承接的项目:模型运行在客户自己的硬件上,没有任何数据到达第三方。过去这要以稳定性为代价。在现在这个模型上不再如此——本地那一列在逐题比对上与两个托管模型中较好的那个持平,而且比两者都更快。
医疗机构
病历受限,承载它们的系统位于防火墙之后,不接受入站访问。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many patients have an abnormal HbA1c and no active endocrine medication? | 11 | 3/3 · 24.3s | 3/3 · 18.4s | 4/4 · 9.8s |
| How many patients on active Warfarin have had an abnormal potassium result? | 5 | 3/3 · 16.5s | 3/3 · 16.6s | 4/4 · 9.6s |
| How many sites have four or more patients with an eGFR below 60? | 3 | 3/3 · 24.6s | 3/3 · 17.9s | 4/4 · 8.7s |
零售与商业银行
交易监控运行在隔离网络上,客户数据受严格管控。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many customers have an escalated alert with no SAR filed? | 8 | 3/3 · 15.3s | 3/3 · 19.3s | 4/4 · 8.2s |
| How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window? | 17 | 3/3 · 27.9s | 3/3 · 37.6s | 4/4 · 29.8s |
| How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)? | 3 | 3/3 · 21.6s | 3/3 · 32.4s | 4/4 · 11.2s |
财产与意外险公司
理赔档案包含具名个人的医疗与财务细节,理赔系统仅可从内网访问。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many claims handled by junior adjusters are litigated and still open? | 5 | 3/3 · 14.3s | 3/3 · 12.2s | 4/4 · 7.4s |
| How many open claims have total payments exceeding their reserve? | 6 | 3/3 · 19.2s | 3/3 · 40.6s | 4/4 · 9.2s |
| Which adjuster team has the highest total paid on litigated claims? | “Desk” | 3/3 · 17.2s | 3/3 · 11.4s | 4/4 · 8.6s |
企业法务部门
受特权保护的材料不仅涉及政策问题,还涉及特权豁免问题,这使边界决策的后果格外重大。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many documents are past their retention date but still under an unreleased legal hold? | 45 | 3/3 · 15.7s | 3/3 · 47.5s | 4/4 · 9.1s |
| How many privileged documents belong to matters that are closed and have no unreleased hold? | 23 | 2/3 · 25.3s | 3/3 · 18.6s | 4/4 · 10.8s |
| Which practice area has the most privileged documents? | “Commercial” | 3/3 · 15.1s | 3/3 · 10.5s | 4/4 · 8.1s |
三个数据可以离开的行业
多数组织属于这一类,而其中许多并不自觉。这些数据没有存放地限制,因此使用已审批的托管模型是合适的——没有需要运维的东西,不必采购硬件,上线也更快。我们会直说,而不是把你并不需要的基础设施卖给你。
线上零售商
订单与库存数据没有存放地限制,因此使用已审批的托管模型是合适的,也最省事。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many products are below their reorder point with no open purchase order? | 6 | 3/3 · 17.2s | 3/3 · 12.8s | 3/4 · 8s |
| Which category generated the most revenue from discounted orders? | “Outdoor” | 3/3 · 16.6s | 3/3 · 10.8s | 4/4 · 10.6s |
| Which supplier has the highest proportion of sold items that were returned? | “Baltic Works” | 3/3 · 19.6s | 3/3 · 14.9s | 4/4 · 14s |
B2B SaaS 服务商
使用量遥测具有商业敏感性,但不受驻留地限制。托管方案合适,且上线更快。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07? | 27 | 3/3 · 17.2s | 3/3 · 21.8s | 4/4 · 15s |
| How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket? | 8 | 3/3 · 24.2s | 3/3 · 37.8s | 4/4 · 16.6s |
| Which plan has the highest total monthly recurring revenue among active subscriptions? | “enterprise” | 3/3 · 12s | 3/3 · 9.9s | 4/4 · 6.1s |
县级房产评估办公室
地块、评估与成交记录属于公开信息。这里没有驻留地问题可谈,因此最能说明「AI 并非不可用」。
| 问题 | 答案 | OpenAI | DeepSeek | Local |
|---|---|---|---|---|
| How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price? | 6 | 3/3 · 16.8s | 3/3 · 18.2s | 4/4 · 10.9s |
| How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026? | 4 | 3/3 · 17.6s | 3/3 · 15.3s | 4/4 · 9.8s |
| Which neighbourhood has the most pending 2026 appeals? | “Cedar Heights” | 3/3 · 17.9s | 3/3 · 12.5s | 4/4 · 7.8s |
用哪个模型由你决定,不由我们决定
多数组织并不需要私有模型,我们会直说。如果你的政策已允许某家经审批的 AI 供应商,托管前沿模型是最省事的一条路:无需采购 GPU、无需运维,准确率如上表。对多数客户而言,这仍然是我们的默认选择。但在这些题目上,它并不是最快的。
我们不会做的,是假装这个选择没有代价。在那种配置下,你的提示词以及智能体读取到的查询结果,会依据你与该服务商的协议发送给它。对相当多的工作负载来说这完全可以接受,且已被既有的供应商评审覆盖。但对某些工作负载并非如此,而那正是我们与众不同、能够处理的情形。
- 托管——我们的默认
- 没有需要运维的东西,也不必采购硬件,按 token 计价。在这里测量的单一配置中最准确——不过优势很小。数据会到达模型供应商。对多数客户在多数时候都适用。
- 在你的硬件上
- 适用于数据确实不能离开的情况。没有数据到达第三方,硬件到位后也没有按 token 的费用。准确率在很大程度上取决于你运行哪个开源模型:本地那一列是一台机器上运行的 36B 混合专家模型;从 30B 的代码模型换成它之后,与托管模型之间的差距被完全抹平。所以教训不是「换个更大的模型就会更好」——是哪个模型、以及它是怎么调优的,远比参数规模重要。
- 混合
- 部署成熟后通常是正确答案:受限数据在本地,其余通过已审批的 API,按用例而非按供应商来决定。
- 之后再切换
- 一行配置。你不是做一次选择就要一直承担它,也不会因此被我们锁定。
有一项结果值得多说一句,因为它推翻了显而易见的假设。此前的测量中,两个托管模型都比本地模型更准确,也都更慢。我们当时把这份延迟归因于往返次数而非模型本身——这是一个智能体循环:它要发现库表结构、描述表、再执行查询,需要多次调用;模型托管在外部时,每一次调用都要跨越公网。更换本地模型正好检验了这个判断。现在这个模型在逐题比对上与两个托管模型中较好的那个持平,响应约 230 秒,而对方是 391 秒和 403 秒。代价确实是往返。「托管就是快、本地才私密」这种说法从来都太简化了——在这些题目上,现在本地才是更快的一方。
OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s
结果会因模型、硬件和每次运行而不同。这里的每个模型都经过多次评测,表中给出的是这些运行的区间与中位数,而不是单次测量——但它们都在同一天完成,并且不构成保证。我们见过同一个本地模型对同一道题在一次运行中答对、在下一次中答错,这正是表格统计运行次数而不是只给出一个结论的原因。如果你在意某个特定模型,诚实的做法是拿这些评分问题去实际测它,而不是相信网页上的一张表——我们会和你一起,在你的数据结构上做这件事。