Ir al contenido
Last Furlong
Idioma: Español

Demostraciones

Siete casos, todos corregidos.

Cada uno plantea preguntas que requieren un join y una agregación sobre un esquema que el agente nunca recibió. Las respuestas se comprueban contra SQL escrito de forma independiente, así que acertar significa que llegó por sí solo.

Cómo leer esta página

Todos los conjuntos de datos que siguen son sintéticos, generados a partir de una semilla fija. No contienen ningún paciente, cliente, siniestro ni material privilegiado real.

Las preguntas no son consultas simples a propósito. Una pregunta de una sola tabla no demuestra nada: un modelo que solo reconoce patrones, sin leer el esquema, también acertaría. Aquí cada una necesita un join y la mayoría necesita una agregación.

Corregido contra
SQL escrito de forma independiente que se guarda junto a cada conjunto de datos. El agente nunca lo ve, y no se derivó de su salida: de lo contrario, acertar no demostraría nada.
Alojado — OpenAI
gpt-5.6-terra: entre 20 y 21 de 21 a lo largo de 3 ejecuciones. Cada una tardó entre 374 y 411s, mediana 403s. La más reciente, 2026-08-03. En esta configuración, los prompts y los resultados de consulta se envían a OpenAI.
Alojado — DeepSeek
deepseek-v4-flash: 21 de 21 correctas en las 3 ejecuciones. Cada una tardó entre 329 y 591s, mediana 391s. La más reciente, 2026-08-03. En esta configuración, los prompts y los resultados de consulta se envían a DeepSeek.
En nuestro hardware
qwen3.6:35b: entre 20 y 21 de 21 a lo largo de 4 ejecuciones. Cada una tardó entre 215 y 242s, mediana 230s. La más reciente, 2026-08-04. Nada salió de la red.
Publicamos los fallos
Cada modelo se evalúa varias veces y la tabla muestra con qué frecuencia se respondió bien cada pregunta, porque una sola ejecución lo tergiversa gravemente. El modelo local no tiene ninguna pregunta que falle siempre, pero sí varias que no responde de forma fiable: una tabla de una sola ejecución las habría mostrado como un fallo rotundo. Los modelos tampoco fallan las mismas preguntas.

Cada casilla cuenta en cuántas ejecuciones de ese modelo se respondió correctamente la pregunta.

Las preguntas se muestran en inglés porque así se plantearon a los modelos. Traducirlas aquí falsearía lo que realmente se ejecutó.

El caso sanitario, grabado

Menos de tres minutos, de principio a fin, incluida la comprobación de qué salió de la red. Cada comando y cada línea de salida son reales.

Se sirve desde este dominio, no es un contenido incrustado: sin reproductor de terceros y sin seguimiento.

Cuatro sectores donde los datos no pueden salir

Estos son los proyectos que resulta poco habitual poder aceptar: el modelo se ejecuta en el hardware del propio cliente y nada llega a un tercero. Antes eso costaba consistencia. Con el modelo actual ya no: la columna local iguala pregunta por pregunta al mejor de los dos modelos alojados, y responde más rápido que ambos.

Proveedor sanitario

Las historias clínicas están restringidas y los sistemas que las guardan están detrás de un cortafuegos sin acceso entrante.

PreguntaRespuestaOpenAIDeepSeekLocal
How many patients have an abnormal HbA1c and no active endocrine medication?113/3 · 24.3s3/3 · 18.4s4/4 · 9.8s
How many patients on active Warfarin have had an abnormal potassium result?53/3 · 16.5s3/3 · 16.6s4/4 · 9.6s
How many sites have four or more patients with an eGFR below 60?33/3 · 24.6s3/3 · 17.9s4/4 · 8.7s

Banca comercial y minorista

La monitorización de transacciones corre en una red segmentada y los datos de clientes están estrictamente gobernados.

PreguntaRespuestaOpenAIDeepSeekLocal
How many customers have an escalated alert with no SAR filed?83/3 · 15.3s3/3 · 19.3s4/4 · 8.2s
How many customers made three or more cash deposits, each under $10,000, that together total more than $10,000 within any 7-day window?173/3 · 27.9s3/3 · 37.6s4/4 · 29.8s
How many politically exposed customers received funds from a high-risk jurisdiction (AE or PA)?33/3 · 21.6s3/3 · 32.4s4/4 · 11.2s

Aseguradora de daños

Los expedientes de siniestros contienen detalle médico y financiero de personas concretas, y el sistema de siniestros solo es accesible desde la red interna.

PreguntaRespuestaOpenAIDeepSeekLocal
How many claims handled by junior adjusters are litigated and still open?53/3 · 14.3s3/3 · 12.2s4/4 · 7.4s
How many open claims have total payments exceeding their reserve?63/3 · 19.2s3/3 · 40.6s4/4 · 9.2s
Which adjuster team has the highest total paid on litigated claims?“Desk”3/3 · 17.2s3/3 · 11.4s4/4 · 8.6s

Departamento jurídico interno

El material privilegiado plantea una cuestión de renuncia al privilegio además de una de política, lo que hace que la decisión sobre el límite tenga consecuencias poco habituales.

PreguntaRespuestaOpenAIDeepSeekLocal
How many documents are past their retention date but still under an unreleased legal hold?453/3 · 15.7s3/3 · 47.5s4/4 · 9.1s
How many privileged documents belong to matters that are closed and have no unreleased hold?232/3 · 25.3s3/3 · 18.6s4/4 · 10.8s
Which practice area has the most privileged documents?“Commercial”3/3 · 15.1s3/3 · 10.5s4/4 · 8.1s

Tres sectores donde sí pueden

La mayoría de las organizaciones está aquí, y muchas no lo saben. Estos datos no tienen restricción de residencia, así que un modelo alojado aprobado es lo adecuado: nada que operar, ningún hardware que comprar y más rápido de poner en marcha. Lo diremos, en lugar de venderte infraestructura que no necesitas.

Comercio electrónico

Los datos de pedidos e inventario no tienen restricción de residencia, así que un modelo alojado aprobado es adecuado y el que menos trabajo da para poner en marcha.

PreguntaRespuestaOpenAIDeepSeekLocal
How many products are below their reorder point with no open purchase order?63/3 · 17.2s3/3 · 12.8s3/4 · 8s
Which category generated the most revenue from discounted orders?“Outdoor”3/3 · 16.6s3/3 · 10.8s4/4 · 10.6s
Which supplier has the highest proportion of sold items that were returned?“Baltic Works”3/3 · 19.6s3/3 · 14.9s4/4 · 14s

Proveedor de SaaS B2B

La telemetría de uso es sensible comercialmente pero no está restringida por residencia. Lo alojado es adecuado y se pone en marcha antes.

PreguntaRespuestaOpenAIDeepSeekLocal
Among accounts whose subscription is not cancelled, how many used fewer than half their licensed seats in 2026-07?273/3 · 17.2s3/3 · 21.8s4/4 · 15s
How many active accounts had fewer active seats in 2026-07 than in 2026-05 and also have an unresolved support ticket?83/3 · 24.2s3/3 · 37.8s4/4 · 16.6s
Which plan has the highest total monthly recurring revenue among active subscriptions?“enterprise”3/3 · 12s3/3 · 9.9s4/4 · 6.1s

Oficina de catastro

Los registros de parcelas, valoraciones y ventas son públicos. No hay ningún argumento de residencia que hacer, lo que lo convierte en el caso más claro de que la IA no está descartada.

PreguntaRespuestaOpenAIDeepSeekLocal
How many parcels have a 2026 assessed value more than 25 percent below their most recent arm's-length sale price?63/3 · 16.8s3/3 · 18.2s4/4 · 10.9s
How many parcels with a pending appeal also had their assessed value rise from 2025 to 2026?43/3 · 17.6s3/3 · 15.3s4/4 · 9.8s
Which neighbourhood has the most pending 2026 appeals?“Cedar Heights”3/3 · 17.9s3/3 · 12.5s4/4 · 7.8s

Qué modelo usar es tu decisión, no la nuestra

La mayoría de las organizaciones no necesita un modelo privado, y lo diremos. Si tu política ya admite un proveedor de IA aprobado, un modelo alojado de frontera es lo que menos trabajo da: sin GPUs que comprar, nada que operar y la precisión que se ve arriba. Sigue siendo nuestra opción por defecto para la mayoría. Lo que no es, en estas preguntas, es lo más rápido.

Lo que no vamos a hacer es fingir que esa elección no tiene consecuencias. En esa configuración, tus prompts y los resultados de consulta que lee el agente se envían al proveedor del modelo según el acuerdo que tengas con él. Para muchísimas cargas de trabajo eso es perfectamente aceptable y ya está cubierto por una revisión de proveedores existente. Para algunas no lo es, y ese es el caso que resulta poco habitual poder atender.

Alojado: nuestra opción por defecto
Nada que operar y ningún hardware que comprar, precio por token. La configuración individual más precisa de las medidas aquí, aunque por poco. Los datos llegan al proveedor del modelo. Adecuado para la mayoría de los clientes la mayor parte del tiempo.
En tu hardware
Para datos que realmente no pueden salir. Nada llega a un tercero y no hay coste por token una vez que existe el hardware. La precisión depende mucho de qué modelo abierto ejecutes: la columna local es una mezcla de expertos de 36B en una sola máquina, y pasar a ella desde un modelo de código de 30B cerró por completo la diferencia con los modelos alojados. Así que la lección no es «un modelo más grande ayudaría»: importó mucho más cuál es el modelo, y cómo está ajustado, que su tamaño.
Mixto
Suele ser la respuesta correcta cuando el despliegue madura: los datos restringidos en local y todo lo demás por una API aprobada, decidido por caso de uso y no por proveedor.
Cambiar después
Una línea de configuración. No eliges una vez para siempre, ni quedas atado a nosotros en ninguno de los dos casos.

Hay un resultado que merece detenerse, porque invierte la suposición obvia. Mediciones anteriores daban a los dos modelos alojados más precisión que al local y menos velocidad, y atribuimos esa latencia a los viajes de ida y vuelta más que a los modelos: esto es un bucle de agente que descubre el esquema, describe tablas y ejecuta una consulta a lo largo de varias llamadas, y cuando el modelo está alojado cada una cruza internet. Cambiar el modelo local puso a prueba esa lectura. El actual iguala pregunta por pregunta al mejor de los alojados y responde en unos 230s frente a sus 391 y 403. El coste eran los viajes. «Lo alojado es rápido, lo local es privado» siempre fue demasiado simple: en estas preguntas, lo local es ahora lo más rápido.

OpenAI 20–21/21 × 3 · 374–411s DeepSeek 21/21 × 3 · 329–591s Local 20–21/21 × 4 · 215–242s

Los resultados varían según el modelo, el hardware y la ejecución. Cada modelo aquí se evaluó varias veces, y las cifras son rangos y medianas de esas ejecuciones, no una única medición; eso sí, todas se tomaron el mismo día y no constituyen una garantía. Hemos visto al mismo modelo local acertar una pregunta en una ejecución y fallarla en la siguiente, que es precisamente por lo que la tabla cuenta ejecuciones en lugar de dar un solo veredicto. Si te importa un modelo concreto, la respuesta honesta es ejecutar estas mismas preguntas corregidas contra él en lugar de confiar en una tabla de una web, y lo haremos contigo, sobre tu esquema.

Meta

¿Quieres verlo sobre tu propio esquema?

Una Evaluación empieza estableciendo qué permiten realmente tus datos, que a menudo es menos restrictivo de lo que se supone. Trae un esquema y una pregunta que hoy no puedas responder.