本文へ移動
Last Furlong
言語: 日本語

実証

7 業種の実例、すべて採点済み。

いずれの質問も結合と集計を必要とし、エージェントにスキーマは与えていません。答えは独立に書かれた SQL と照合するので、正解は自力で到達したことを意味します。

このページの読み方

以下のデータセットはすべて合成で、固定シードから生成しています。実在の患者、顧客、保険金請求、秘匿特権資料は一切含みません。

質問は意図的に単純検索にしていません。単一テーブルの質問では何も証明できません。スキーマを読まずパターン一致するだけのモデルでも正解できてしまいます。ここでは各質問が結合を必要とし、大半は集計も必要とします。

採点の基準
各データセットと共に保持している、独立に書かれた SQL です。エージェントはそれを見ることがなく、またエージェントの出力から導いたものでもありません。そうでなければ正解に意味がありません。
ホスト型 — OpenAI
gpt-5.6-terra — 3 回の実行で 21 問中 20〜21 問正解。1 回あたり 374〜411 秒、中央値 403 秒。直近の実行は 2026-08-03。 この構成では、プロンプトとクエリ結果は OpenAI に送信されます。
ホスト型 — DeepSeek
deepseek-v4-flash — 3 回すべてで 21 問中 21 問正解。1 回あたり 329〜591 秒、中央値 391 秒。直近の実行は 2026-08-03。 この構成では、プロンプトとクエリ結果は DeepSeek に送信されます。
自社ハードウェア上
qwen3.6:35b — 4 回の実行で 21 問中 20〜21 問正解。1 回あたり 215〜242 秒、中央値 230 秒。直近の実行は 2026-08-04。 ネットワークから出たものはありません。
失敗も公開します
各モデルは複数回採点し、表は各問題に正解した回数を示します。1 回の実行では実態を大きく取り違えるからです。ローカルモデルには「必ず間違える問題」はひとつもありません。ただし安定して正解できない問題がいくつかあり、1 回だけの表ならそれらを一律の不正解として見せていたはずです。また、モデルごとに間違える問題も一致しません。

各セルは、そのモデルの実行のうち何回正解したかを表します。

質問は英語のまま掲載しています。モデルに実際に投げたのが英語だからです。ここで翻訳すると、実際に実行した内容と食い違ってしまいます。

医療の実例、収録版

3 分未満で端から端まで。ネットワークから何が出ていったかの検証も含みます。すべてのコマンドと出力行は実物です。

動画は当サイト自身のドメインから配信しており、外部埋め込みではありません。第三者プレーヤーも追跡もありません。

データを社外に出せない 4 業種

これらは、当社が引き受けられること自体が珍しい案件です。モデルはお客様自身のハードウェア上で動き、第三者には何も届きません。以前はその代償が安定性でした。現在のモデルではそうではありません——ローカルの列は、ホスト型 2 モデルの優秀な方と問題ごとに互角で、しかもどちらより速く答えます。

医療機関

診療記録は制限されており、それを保持するシステムはファイアウォールの内側で受信接続を受け付けません。

質問正解OpenAIDeepSeekLocal
How many patients have an abnormal HbA1c and no active endocrine medication?113/3 · 24.3s3/3 · 18.4s4/4 · 9.8s
How many patients on active Warfarin have had an abnormal potassium result?53/3 · 16.5s3/3 · 16.6s4/4 · 9.6s
How many sites have four or more patients with an eGFR below 60?33/3 · 24.6s3/3 · 17.9s4/4 · 8.7s

リテール・商業銀行

取引モニタリングは分離ネットワーク上で動き、顧客データは厳格に管理されています。

質問正解OpenAIDeepSeekLocal
How many customers have an escalated alert with no SAR filed?83/3 · 15.3s3/3 · 19.3s4/4 · 8.2s
How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window?173/3 · 27.9s3/3 · 37.6s4/4 · 29.8s
How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)?33/3 · 21.6s3/3 · 32.4s4/4 · 11.2s

損害保険会社

請求ファイルには特定個人の医療・財務情報が含まれ、請求システムは内部ネットワークからのみ到達できます。

質問正解OpenAIDeepSeekLocal
How many claims handled by junior adjusters are litigated and still open?53/3 · 14.3s3/3 · 12.2s4/4 · 7.4s
How many open claims have total payments exceeding their reserve?63/3 · 19.2s3/3 · 40.6s4/4 · 9.2s
Which adjuster team has the highest total paid on litigated claims?“Desk”3/3 · 17.2s3/3 · 11.4s4/4 · 8.6s

企業法務部門

秘匿特権資料はポリシーだけでなく特権放棄の問題を生じさせるため、境界の判断が特に重い結果を持ちます。

質問正解OpenAIDeepSeekLocal
How many documents are past their retention date but still under an unreleased legal hold?453/3 · 15.7s3/3 · 47.5s4/4 · 9.1s
How many privileged documents belong to matters that are closed and have no unreleased hold?232/3 · 25.3s3/3 · 18.6s4/4 · 10.8s
Which practice area has the most privileged documents?“Commercial”3/3 · 15.1s3/3 · 10.5s4/4 · 8.1s

データを出せる 3 業種

多くの組織はこちらに該当し、その多くが自覚していません。これらのデータには所在地の制約がないため、承認済みのホスト型モデルが適切です——運用するものがなく、購入するハードウェアもなく、立ち上げも早い。必要のないインフラを売るのではなく、そう申し上げます。

オンライン小売

注文と在庫のデータには所在地の制約がないため、承認済みのホスト型モデルが適切で、立ち上げの手間も最小です。

質問正解OpenAIDeepSeekLocal
How many products are below their reorder point with no open purchase order?63/3 · 17.2s3/3 · 12.8s3/4 · 8s
Which category generated the most revenue from discounted orders?“Outdoor”3/3 · 16.6s3/3 · 10.8s4/4 · 10.6s
Which supplier has the highest proportion of sold items that were returned?“Baltic Works”3/3 · 19.6s3/3 · 14.9s4/4 · 14s

B2B SaaS 事業者

利用状況のテレメトリは商業上機密ですが所在地の制約はありません。ホスト型が適切で、立ち上げも速いです。

質問正解OpenAIDeepSeekLocal
Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07?273/3 · 17.2s3/3 · 21.8s4/4 · 15s
How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket?83/3 · 24.2s3/3 · 37.8s4/4 · 16.6s
Which plan has the highest total monthly recurring revenue among active subscriptions?“enterprise”3/3 · 12s3/3 · 9.9s4/4 · 6.1s

郡の資産評価事務所

区画・評価・売買記録は公開情報です。所在地の議論の余地がなく、「AI は選択肢外ではない」ことを最も明確に示します。

質問正解OpenAIDeepSeekLocal
How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price?63/3 · 16.8s3/3 · 18.2s4/4 · 10.9s
How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026?43/3 · 17.6s3/3 · 15.3s4/4 · 9.8s
Which neighbourhood has the most pending 2026 appeals?“Cedar Heights”3/3 · 17.9s3/3 · 12.5s4/4 · 7.8s

どのモデルを使うかはお客様の判断です

多くの組織にプライベートモデルは必要ありません。そう申し上げます。ポリシーが承認済みの AI 事業者を既に許しているなら、ホスト型のフロンティアモデルが最も手間がかかりません。購入する GPU もなく、運用するものもなく、精度は上のとおりです。多くのお客様に対しては引き続きこれが既定です。ただし、これらの問題において最速ではありません。

当社がしないのは、その選択に何の帰結もないふりをすることです。その構成では、プロンプトとエージェントが読み取ったクエリ結果が、お客様と当該事業者との契約に基づいてモデル提供事業者へ送信されます。多くのワークロードではこれは完全に許容範囲で、既存のベンダー審査で既にカバーされています。そうでないものもあり、それこそ当社が扱える点で珍しいケースです。

ホスト型——当社の既定
運用するものがなく、購入するハードウェアもなく、トークン単位の課金です。ここで計測した単一構成としては最も精度が高い——ただし差はわずかです。データはモデル提供事業者に届きます。多くのお客様に、多くの場合適します。
お客様のハードウェア上
データを本当に社外へ出せない場合に。第三者には何も届かず、ハードウェアが揃えばトークン単位の費用もありません。精度はどのオープンモデルを動かすかに大きく依存します。ローカルの列は 1 台のマシン上で動く 36B の混合エキスパートモデルで、30B のコーダーモデルからこれに移したことで、ホスト型との差は完全に埋まりました。つまり教訓は「より大きなモデルなら良くなる」ではありません。どのモデルか、そしてどう調整されているかが、規模よりはるかに重要でした。
併用
配備が成熟すると通常これが正解です。制限データはローカル、それ以外は承認済み API 経由。ベンダー単位ではなくユースケース単位で決めます。
後から切り替える
構成 1 行です。一度選んだら固定されるわけではなく、当社に固定されるわけでもありません。

ひとつ、明らかな思い込みを覆す結果があります。以前の計測では、ホスト型の 2 モデルはローカルより精度が高く、そして遅かった。その遅さはモデルではなく往復回数によるものだと考えていました——これはエージェントのループで、スキーマを発見し、テーブルを説明し、クエリを実行するまでに複数回の呼び出しが必要で、モデルがホスト型ならそのたびにインターネットを越えます。ローカルモデルを入れ替えて、その読みを検証しました。現在のモデルは、ホスト型の優秀な方と問題ごとに互角で、応答は約 230 秒。相手は 391 秒と 403 秒です。コストは往復回数でした。「ホスト型は速く、ローカルは安全」という整理は元から単純すぎました——これらの問題では、いまローカルの方が速いのです。

OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s

結果はモデル、ハードウェア、そして実行ごとに変わります。ここに挙げた各モデルは複数回採点しており、表の数値は単発の計測ではなくそれらの実行の範囲と中央値です——ただしすべて同じ日の計測であり、保証ではありません。同じローカルモデルが同じ問題を、ある実行では正解し次の実行では間違えるのを見ています。表が単一の結論ではなく実行回数を数えているのは、まさにそのためです。特定のモデルが重要なら、誠実な答えはウェブの表を信じるのではなく、この採点済みの問題を実際にそのモデルへ当てることです——お客様のスキーマ上で、ご一緒に行います。

ゴール

お客様のスキーマで実行してみますか。

「評価」の出発点は、お客様のデータが実際に何を許しているかの確認です。多くの場合、思われているより制約は緩いものです。スキーマと、今は答えられない質問をお持ちください。