presupuesto-nlq-mx
Hazle una pregunta en español al presupuesto federal de México y ve el SQL que la respondió.
01Problema
México publica su presupuesto federal como datos abiertos, pero leerlo exige saber de análisis de datos y de contabilidad gubernamental. Las cifras viven en tablas con claves alfanuméricas que solo tienen sentido junto a catálogos externos; las reglas que las explican viven en PDFs normativos. Los datos son abiertos, pero la mayoría de la gente no puede usarlos.
02Enfoque
Un sistema que responde preguntas en español por una de dos rutas. La ruta de datos traduce la pregunta a SQL sobre una capa semántica documentada, lo valida, lo ejecuta con un rol de solo lectura y devuelve la tabla junto con la consulta exacta. La ruta documental recupera fragmentos de la normatividad oficial y responde con citas. Un enrutador elige la ruta, y el sistema se abstiene cuando la evidencia no alcanza para responder.
- filas de hechos cargadas y conciliadas
- 1,285,233
- ejercicios fiscales normalizados, 2020–2025
- 6
- dimensiones conformadas
- 12
- pruebas de seguridad aprobadas
- 11/11
03Arquitectura
- Construido
- En curso
- Planeado
En español, lenguaje natural
LLM vs clasificador entrenado vs ambas rutas
Ruta de datos · text-to-SQL
Vistas descriptivas + documentación de clasificaciones v1
Un solo SELECT; rechaza SET y set_config()
Rol consulta_nlq, límite de 15 s
La consulta siempre a la vista
Ruta documental · RAG
Artículos y fracciones con su procedencia
BM25 vs densa vs híbrida, ± reordenamiento
La fidelidad se mide por separado
Cada afirmación apunta a su fuente
Cimientos
Esquema en estrella · 1,285,233 filas · carga validada
61 preguntas redactadas · verificación humana
Cualquiera de las dos rutas puede terminar en abstención. Cuando la evidencia no sustenta una respuesta, decirlo es la salida correcta.
04Notas de ingeniería
El CSV y el XLSX no coinciden.
La Secretaría de Hacienda publica cada ejercicio fiscal en CSV y en XLSX. Un cruce fila por fila mostró que no son equivalentes, así que el formato de origen se elige por año. Toda corrección queda declarada en una bitácora de normalización, porque una corrección silenciosa es indistinguible de alterar el dato.
La carga corre en una sola transacción y termina conciliando conteos de filas y totales por etapa (aprobado, devengado, pagado) contra la fuente, al peso. Cualquier diferencia revierte la carga completa. Si la bitácora de carga existe, la validación pasó.
| Año | Fuente | Motivo |
|---|---|---|
| 2020 | .xlsx | El CSV pierde 10 filas |
| 2021 | .xlsx | El CSV pierde 2 filas y deja importes en blanco |
| 2022 | .xlsx | El CSV pierde 3 filas y agrega 828,067 de relleno |
| 2023 | .xlsx | El CSV pierde 1 fila y corrompe una llave |
| 2024 | .xlsx | El CSV reporta MXN 9,699 M de más en el ramo 51 |
| 2025 | .csv | Formatos idénticos; el CSV se lee más rápido |