본문으로 이동
Last Furlong
언어: 한국어

실증

7개 산업 사례, 전부 채점.

모든 질문이 조인과 집계를 요구하며, 에이전트에게 스키마를 주지 않았습니다. 답은 독립적으로 작성한 SQL과 대조하므로, 정답은 스스로 도달했다는 뜻입니다.

이 페이지를 읽는 방법

아래 데이터셋은 모두 합성이며 고정 시드로 생성했습니다. 실제 환자, 고객, 보험금 청구, 특권 자료는 하나도 없습니다.

질문은 의도적으로 단순 조회가 아닙니다. 단일 테이블 질문은 아무것도 증명하지 못합니다. 스키마를 읽지 않고 패턴만 맞추는 모델도 맞힐 수 있기 때문입니다. 여기서는 각 질문이 조인을 요구하고 대부분 집계까지 요구합니다.

채점 기준
각 데이터셋과 함께 보관하는, 독립적으로 작성한 SQL입니다. 에이전트는 그것을 보지 못하며, 에이전트 출력에서 역으로 만든 것도 아닙니다. 그렇지 않다면 정답에 의미가 없습니다.
호스팅 — OpenAI
gpt-5.6-terra — 3회 실행에서 21문 중 20~21문 정답. 1회당 374~411초, 중앙값 403초. 최근 실행 2026-08-03. 이 구성에서는 프롬프트와 조회 결과가 OpenAI에 전송됩니다.
호스팅 — DeepSeek
deepseek-v4-flash — 3회 실행 모두에서 21문 중 21문 정답. 1회당 329~591초, 중앙값 391초. 최근 실행 2026-08-03. 이 구성에서는 프롬프트와 조회 결과가 DeepSeek에 전송됩니다.
자체 하드웨어에서
qwen3.6:35b — 4회 실행에서 21문 중 20~21문 정답. 1회당 215~242초, 중앙값 230초. 최근 실행 2026-08-04. 네트워크를 벗어난 데이터는 없습니다.
실패도 공개합니다
각 모델을 여러 번 채점하고, 표에는 각 문항을 몇 번 맞혔는지를 표시합니다. 한 번의 실행은 실상을 크게 왜곡하기 때문입니다. 로컬 모델에는 항상 틀리는 문항이 하나도 없습니다. 다만 안정적으로 맞히지 못하는 문항이 몇 개 있으며, 단일 실행 표라면 그것들을 그냥 오답으로 보여줬을 것입니다. 또한 모델마다 틀리는 문항이 서로 다릅니다.

각 칸은 해당 모델의 실행 중 몇 번이나 정답을 냈는지를 나타냅니다.

질문은 영어 원문으로 표시합니다. 모델에 실제로 영어로 질문했기 때문입니다. 여기서 번역하면 실제 실행한 내용과 달라집니다.

의료 사례, 녹화본

3분 이내, 처음부터 끝까지. 네트워크에서 무엇이 나갔는지 확인하는 검증도 포함합니다. 모든 명령과 모든 출력 줄이 실제입니다.

영상은 이 사이트 자체 도메인에서 제공하며 외부 임베드가 아닙니다. 제3자 플레이어도, 추적도 없습니다.

데이터가 나갈 수 없는 4개 산업

이런 프로젝트를 맡을 수 있다는 점이 저희의 드문 강점입니다. 모델은 고객사 자체 하드웨어에서 돌고, 제3자에게는 아무것도 도달하지 않습니다. 예전에는 그 대가가 일관성이었습니다. 현재 모델에서는 그렇지 않습니다 — 로컬 열은 호스팅 모델 둘 중 더 나은 쪽과 문항별로 대등하고, 두 모델보다 빠르게 답합니다.

의료기관

진료 기록은 제한되며, 이를 보관하는 시스템은 방화벽 안에서 인바운드 접근을 받지 않습니다.

질문정답OpenAIDeepSeekLocal
How many patients have an abnormal HbA1c and no active endocrine medication?113/3 · 24.3s3/3 · 18.4s4/4 · 9.8s
How many patients on active Warfarin have had an abnormal potassium result?53/3 · 16.5s3/3 · 16.6s4/4 · 9.6s
How many sites have four or more patients with an eGFR below 60?33/3 · 24.6s3/3 · 17.9s4/4 · 8.7s

리테일·상업 은행

거래 모니터링은 분리된 네트워크에서 돌고, 고객 데이터는 엄격히 통제됩니다.

질문정답OpenAIDeepSeekLocal
How many customers have an escalated alert with no SAR filed?83/3 · 15.3s3/3 · 19.3s4/4 · 8.2s
How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window?173/3 · 27.9s3/3 · 37.6s4/4 · 29.8s
How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)?33/3 · 21.6s3/3 · 32.4s4/4 · 11.2s

손해보험사

청구 파일에는 특정 개인의 의료·재무 정보가 있고, 청구 시스템은 내부 네트워크에서만 접근됩니다.

질문정답OpenAIDeepSeekLocal
How many claims handled by junior adjusters are litigated and still open?53/3 · 14.3s3/3 · 12.2s4/4 · 7.4s
How many open claims have total payments exceeding their reserve?63/3 · 19.2s3/3 · 40.6s4/4 · 9.2s
Which adjuster team has the highest total paid on litigated claims?“Desk”3/3 · 17.2s3/3 · 11.4s4/4 · 8.6s

사내 법무팀

특권 자료는 정책 문제뿐 아니라 특권 포기 문제까지 일으키므로, 경계 판단의 결과가 특히 무겁습니다.

질문정답OpenAIDeepSeekLocal
How many documents are past their retention date but still under an unreleased legal hold?453/3 · 15.7s3/3 · 47.5s4/4 · 9.1s
How many privileged documents belong to matters that are closed and have no unreleased hold?232/3 · 25.3s3/3 · 18.6s4/4 · 10.8s
Which practice area has the most privileged documents?“Commercial”3/3 · 15.1s3/3 · 10.5s4/4 · 8.1s

데이터가 나갈 수 있는 3개 산업

대부분의 조직이 여기에 해당하고, 많은 곳이 그것을 모릅니다. 이 데이터에는 보관지 제약이 없으므로 승인된 호스팅 모델이 적합합니다 — 운영할 것이 없고, 구입할 하드웨어가 없고, 도입도 더 빠릅니다. 필요 없는 인프라를 팔기보다 그렇게 말씀드립니다.

온라인 소매

주문과 재고 데이터에는 보관지 제약이 없으므로 승인된 호스팅 모델이 적합하고, 도입에 드는 손이 가장 적습니다.

질문정답OpenAIDeepSeekLocal
How many products are below their reorder point with no open purchase order?63/3 · 17.2s3/3 · 12.8s3/4 · 8s
Which category generated the most revenue from discounted orders?“Outdoor”3/3 · 16.6s3/3 · 10.8s4/4 · 10.6s
Which supplier has the highest proportion of sold items that were returned?“Baltic Works”3/3 · 19.6s3/3 · 14.9s4/4 · 14s

B2B SaaS 사업자

사용 텔레메트리는 상업적으로 민감하지만 보관지 제약은 없습니다. 호스팅이 적절하고 더 빨리 올라갑니다.

질문정답OpenAIDeepSeekLocal
Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07?273/3 · 17.2s3/3 · 21.8s4/4 · 15s
How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket?83/3 · 24.2s3/3 · 37.8s4/4 · 16.6s
Which plan has the highest total monthly recurring revenue among active subscriptions?“enterprise”3/3 · 12s3/3 · 9.9s4/4 · 6.1s

카운티 재산평가청

필지·평가·거래 기록은 공개 정보입니다. 보관지를 논할 여지가 없어 「AI가 선택지 밖이 아니다」를 가장 분명히 보여줍니다.

질문정답OpenAIDeepSeekLocal
How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price?63/3 · 16.8s3/3 · 18.2s4/4 · 10.9s
How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026?43/3 · 17.6s3/3 · 15.3s4/4 · 9.8s
Which neighbourhood has the most pending 2026 appeals?“Cedar Heights”3/3 · 17.9s3/3 · 12.5s4/4 · 7.8s

어떤 모델을 쓸지는 고객사의 결정입니다

대부분의 조직에는 프라이빗 모델이 필요하지 않고, 저희는 그렇게 말합니다. 정책이 이미 승인된 AI 공급사를 허용한다면, 호스팅 프런티어 모델이 가장 손이 덜 갑니다. 구입할 GPU도, 운영할 것도 없고, 정확도는 위와 같습니다. 대부분의 고객사에게는 여전히 이것이 기본값입니다. 다만 이 문항들에서 가장 빠른 것은 아닙니다.

저희가 하지 않는 것은, 그 선택에 아무 결과가 없는 척하는 일입니다. 그 구성에서는 프롬프트와 에이전트가 읽은 쿼리 결과가 고객사와 해당 제공사 간 계약에 따라 모델 제공사로 전송됩니다. 상당히 많은 워크로드에서 이는 전적으로 수용 가능하며 기존 벤더 검토로 이미 커버됩니다. 그렇지 않은 경우도 있고, 그것이 저희가 다룰 수 있다는 점에서 드문 사례입니다.

호스팅 — 저희 기본값
운영할 것도 구입할 하드웨어도 없고, 토큰 단위 과금입니다. 여기서 측정한 단일 구성 중 가장 정확하지만, 차이는 크지 않습니다. 데이터는 모델 공급사에 도달합니다. 대부분의 고객사에게 대체로 적합합니다.
고객사 하드웨어에서
데이터를 정말로 외부로 보낼 수 없을 때. 제3자에게 아무것도 도달하지 않고, 하드웨어가 갖춰지면 토큰당 비용도 없습니다. 정확도는 어떤 오픈 모델을 돌리는지에 크게 좌우됩니다. 로컬 열은 한 대의 장비에서 돌아가는 36B 전문가 혼합 모델이며, 30B 코더 모델에서 이것으로 옮기면서 호스팅 모델과의 격차가 완전히 사라졌습니다. 따라서 교훈은 「더 큰 모델이면 나아진다」가 아닙니다. 어떤 모델인지, 어떻게 튜닝되었는지가 크기보다 훨씬 중요했습니다.
혼합
배치가 성숙하면 대개 이게 정답입니다. 제한 데이터는 로컬, 나머지는 승인된 API로. 벤더 단위가 아니라 유스케이스 단위로 결정합니다.
나중에 전환
설정 한 줄입니다. 한 번 고르면 계속 매여 있는 것도 아니고, 저희에게 종속되는 것도 아닙니다.

명백한 가정을 뒤집는 결과가 하나 있어 짚어둘 만합니다. 이전 측정에서는 호스팅 모델 두 개가 로컬보다 정확했고 또 느렸습니다. 그 지연은 모델 때문이 아니라 왕복 횟수 때문이라고 봤습니다 — 이것은 에이전트 루프이며, 스키마를 발견하고 테이블을 설명하고 질의를 실행하기까지 여러 번 호출해야 하고, 모델이 외부에 있으면 그 호출마다 인터넷을 건넙니다. 로컬 모델을 교체해 그 해석을 검증했습니다. 현재 모델은 호스팅 모델 중 더 나은 쪽과 문항별로 대등하며, 약 230초에 답합니다. 상대는 391초와 403초입니다. 비용은 왕복이었습니다. 「호스팅은 빠르고 로컬은 안전하다」는 정리는 처음부터 너무 단순했습니다 — 이 문항들에서는 이제 로컬이 더 빠릅니다.

OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s

결과는 모델, 하드웨어, 그리고 실행마다 달라집니다. 여기 있는 각 모델은 여러 번 채점했고, 표의 수치는 단일 측정이 아니라 그 실행들의 범위와 중앙값입니다 — 다만 모두 같은 날 측정한 값이며 보증이 아닙니다. 같은 로컬 모델이 같은 문항을 한 번은 맞히고 다음 번에는 틀리는 것을 저희도 봤습니다. 표가 하나의 결론이 아니라 실행 횟수를 세는 이유가 바로 그것입니다. 특정 모델이 중요하다면, 정직한 답은 웹페이지의 표를 믿는 것이 아니라 이 채점 문항을 그 모델에 직접 돌려보는 것입니다 — 고객사 스키마에서 함께 하겠습니다.

결승선

고객사 스키마에서 돌려보시겠습니까?

「진단」의 출발점은 고객사 데이터가 실제로 무엇을 허용하는지 확인하는 것입니다. 흔히 생각보다 제약이 덜합니다. 스키마와, 지금은 답할 수 없는 질문을 가져오십시오.