📌 En resumen
Medir la calidad de datos requiere KPIs concretos, no declaraciones de intenciones. Los seis indicadores fundamentales son completitud, unicidad, exactitud, consistencia, oportunidad y validez. Cada uno tiene una fórmula de cálculo clara, umbrales de referencia y un papel específico en la operativa de la empresa. Esta guía detalla cómo calcularlos, qué umbrales fijar según el contexto, cómo diseñar un dashboard de calidad y cómo automatizar la monitorización.
La frase «nuestros datos no son fiables» aparece en casi todas las reuniones sobre BI, IA o automatización. Pero cuando preguntas qué significa exactamente «no fiables», la respuesta suele ser vaga. Faltan datos, hay duplicados, los números no cuadran. Todo a la vez y nada concreto.
El problema no es que la calidad sea mala. El problema es que no se mide. Y lo que no se mide no se gestiona. Definir KPIs de calidad de datos convierte una queja difusa en algo accionable: un número, un umbral, un responsable y un proceso de corrección.
Por qué medir la calidad de datos
La calidad de datos no es un tema académico. Tiene impacto directo en tres áreas que afectan a la cuenta de resultados.
- Decisiones: si los datos de ventas tienen duplicados, los informes mienten. Si el CRM tiene registros incompletos, el scoring de clientes falla. Cada dato incorrecto introduce error en las decisiones que dependen de él.
- Eficiencia operativa: los equipos dedican horas a limpiar datos manualmente, cruzar fuentes para verificar números y corregir errores que podrían haberse detectado de forma automática.
- Cumplimiento: normativas como el RGPD y el AI Act exigen calidad, trazabilidad y gobernanza de los datos. Sin métricas, no puedes demostrar que cumples.
Según DAMA International, los seis pilares de calidad de datos más aceptados son: completitud, unicidad, exactitud, consistencia, oportunidad y validez. No son los únicos posibles, pero cubren la práctica totalidad de problemas habituales.
Los seis KPIs fundamentales
1. Completitud (Completeness)
Mide el porcentaje de campos que tienen un valor frente al total de campos que deberían tenerlo. No todos los campos vacíos son un problema (hay campos opcionales), así que la completitud se mide sobre campos obligatorios o esperados.
Fórmula: Completitud (%) = (Registros con el campo relleno / Total de registros) × 100
Ejemplo: si tu tabla de clientes tiene 10.000 registros y 9.200 tienen el campo «email» relleno, la completitud de email es del 92 %.
Umbral orientativo: para campos críticos (email de contacto, NIF, código de producto), lo razonable es exigir un 95 %+ de completitud. Para campos secundarios, un 80 % puede ser aceptable.
2. Unicidad (Uniqueness)
Mide el porcentaje de registros que son únicos frente al total, identificando duplicados. Los duplicados son uno de los problemas más comunes y más dañinos: inflan métricas, generan comunicaciones dobles y distorsionan análisis.
Fórmula: Unicidad (%) = (Registros únicos / Total de registros) × 100
Ejemplo: si tienes 10.000 registros de clientes y 400 son duplicados, la unicidad es del 96 %.
Umbral orientativo: en tablas maestras (clientes, productos, proveedores), la unicidad debería ser superior al 98 %. En tablas transaccionales, el umbral depende del proceso, pero un 99 %+ es deseable.
3. Exactitud (Accuracy)
Mide si los valores almacenados reflejan correctamente la realidad. Es el KPI más difícil de medir porque requiere una fuente de verdad contra la que comparar. No siempre es posible validar todos los registros, pero sí se pueden aplicar controles sobre muestras o mediante cruces con fuentes externas.
Fórmula: Exactitud (%) = (Registros correctos según fuente de referencia / Total de registros verificados) × 100
Ejemplo: verificas una muestra de 500 direcciones de envío contra la base de datos de Correos y 470 son correctas. La exactitud de direcciones es del 94 %.
Umbral orientativo: depende mucho del dominio. Para datos financieros o de facturación, la exactitud debería ser superior al 99 %. Para datos de contacto, un 90-95 % ya es un buen indicador.
4. Consistencia (Consistency)
Mide si el mismo dato tiene el mismo valor en distintos sistemas o tablas. Si el importe de una factura es diferente en el ERP y en el data warehouse, hay un problema de consistencia. Este KPI es especialmente relevante en empresas con múltiples sistemas que comparten datos.
Este es, en la práctica, el problema más frecuente al integrar varios sistemas: un ERP, un CRM y una base de datos operacional describen el mismo hecho de negocio con nombres de campo y formatos distintos, y a veces con cifras distintas. Frente a intentar cuadrar los tres a mano cada mes, medir la consistencia como KPI convierte ese desajuste en algo visible y priorizable, en lugar de una sospecha que cada área explica a su manera.
Fórmula: Consistencia (%) = (Registros coincidentes entre sistemas / Total de registros comparados) × 100
Ejemplo: comparas 5.000 facturas entre el ERP y el warehouse. En 4.850 casos el importe coincide exactamente. La consistencia es del 97 %.
Umbral orientativo: para datos financieros, la consistencia debería ser del 99 %+. Para datos operativos que pasan por transformaciones, un 95 %+ es razonable como punto de partida.
5. Oportunidad (Timeliness)
Mide si los datos están disponibles cuando se necesitan. Un dato correcto que llega tres días tarde puede ser inútil para una decisión que se toma hoy. La oportunidad se mide como el porcentaje de datos que cumplen con el SLA de frescura definido.
Fórmula: Oportunidad (%) = (Cargas dentro del SLA / Total de cargas programadas) × 100
Ejemplo: tienes un pipeline que debe actualizar datos de ventas cada día a las 7:00. En los últimos 30 días, 28 cargas se completaron a tiempo. La oportunidad es del 93 %.
Umbral orientativo: para procesos críticos (reporting diario, alimentación de modelos), un 95 %+ es el mínimo. Para procesos menos urgentes, un 90 % puede ser aceptable.
6. Validez (Validity)
Mide si los datos cumplen con las reglas de formato, dominio y lógica de negocio definidas. Un email sin arroba, un código postal de seis dígitos en España o una fecha de nacimiento en el futuro son ejemplos de datos no válidos.
Fórmula: Validez (%) = (Registros que cumplen las reglas de validación / Total de registros) × 100
Ejemplo: aplicas 15 reglas de validación sobre tu tabla de pedidos (formato de código, rangos de importe, fechas lógicas). De 20.000 registros, 19.400 pasan todas las reglas. La validez es del 97 %.
Umbral orientativo: un 95 %+ es un objetivo razonable para tablas críticas. Las reglas deben ser específicas y mantenidas: una regla desactualizada genera falsos positivos que erosionan la confianza en la métrica.
Siguiente paso
Gobierno del dato y calidad
Definimos y monitorizamos los KPIs de calidad correctos para tu empresa.
Saber más →Cómo diseñar un dashboard de calidad de datos
Medir los KPIs está bien. Que alguien los vea y actúe sobre ellos es lo que marca la diferencia. Un dashboard de calidad de datos centraliza los indicadores, muestra tendencias y alerta cuando algo se degrada. Si ya usas Power BI, es una extensión natural de tu entorno de reporting. Lo cubrimos en calidad de datos en informes de Power BI.
Un buen dashboard de calidad debería incluir:
- Vista general con los seis KPIs agregados por tabla o dominio de datos, con código de color (verde/amarillo/rojo según umbrales).
- Tendencia temporal: los KPIs no son estáticos. Ver cómo evolucionan semana a semana permite detectar degradaciones antes de que se conviertan en crisis.
- Detalle por fuente o sistema: si la completitud de emails cae, necesitas saber si el problema viene del CRM, de la web o de una migración reciente.
- Top de problemas: los 10 campos o reglas que más fallan, ordenados por impacto. Esto orienta el esfuerzo de corrección.
- Responsable asignado: cada métrica debería tener un data owner visible en el dashboard. Sin responsable claro, los problemas se quedan sin resolver.
ℹ️ Nota
El dashboard de calidad no es un informe bonito para una presentación. Es una herramienta operativa que el equipo de datos y los data owners deberían consultar con la misma frecuencia con la que se actualizan los datos.
Definir umbrales: dónde poner la línea
Los umbrales no son universales. Dependen del dominio, de la criticidad del dato y de lo que tu empresa puede absorber como error. Estos son los criterios para definirlos.
- 1Empieza por medir sin umbral. Antes de fijar un objetivo, necesitas saber dónde estás. Mide durante 2-4 semanas para tener un baseline realista.
- 2Define umbrales por criticidad. Los datos que alimentan facturación, compliance o modelos de IA necesitan umbrales más estrictos que los datos de un informe mensual interno.
- 3Usa tres niveles: verde (cumple), amarillo (alerta, requiere atención) y rojo (crítico, acción inmediata). Ejemplo: completitud de email — verde >95 %, amarillo 85-95 %, rojo <85 %.
- 4Revisa y ajusta periódicamente. Los umbrales no son permanentes. A medida que la calidad mejora, puedes subirlos. Si un umbral nunca se incumple, puede que esté demasiado bajo.
Automatizar la monitorización de calidad
Medir manualmente no escala. Si tienes decenas de tablas y cientos de campos, necesitas que las validaciones se ejecuten automáticamente como parte de tus pipelines de datos. Lo abordamos en detalle en calidad de datos en pipelines ETL.
Las herramientas más utilizadas para automatizar:
- Great Expectations: framework open source para definir «expectations» (reglas de calidad) y ejecutarlas contra tus datos en cada carga. Se integra con Airflow, dbt y la mayoría de warehouses.
- Soda: herramienta de monitorización de calidad que permite definir checks en YAML y ejecutarlos contra bases de datos, warehouses o ficheros. Tiene versión open source y cloud.
- dbt tests: si usas dbt para transformación, puedes añadir tests de calidad (not_null, unique, accepted_values, relationships) directamente en los modelos. Sencillo y efectivo para validaciones básicas.
- SQL personalizado: para equipos sin herramientas específicas, un conjunto de consultas SQL programadas que calculan los KPIs y escriben los resultados en una tabla de métricas es un buen punto de partida.
Lo mínimo viable: alertas automáticas (email, Slack, Teams) cuando un KPI cae por debajo del umbral rojo. Sin alertas, el dashboard se convierte en algo que nadie mira hasta que ya es tarde.
Errores frecuentes al medir calidad de datos
- Medir todo sin priorizar. Arrancar con 200 reglas de calidad genera fatiga y nadie sabe por dónde empezar a corregir. Empieza con los 10-15 campos más críticos.
- No asignar responsables. Si la completitud de un campo cae y nadie es responsable de corregirlo, la métrica baja y se queda así.
- Definir umbrales irreales. Poner un umbral del 100 % en exactitud garantiza que siempre estarás en rojo. Los umbrales deben ser ambiciosos pero alcanzables.
- Medir solo una vez. La calidad de datos no es un proyecto: es un proceso continuo. Medir en un momento puntual y no volver a revisarlo pierde el sentido.
- No conectar la calidad con el impacto. Si no puedes explicar qué pasa cuando la calidad baja (informes erróneos, decisiones equivocadas, incumplimiento), la métrica no va a recibir atención de la dirección.
De la medición a la acción
Medir es el primer paso, pero el valor está en lo que haces con los resultados. Un proceso de mejora de calidad de datos funciona así:
- 1Detectar: los KPIs y las alertas identifican que algo ha caído por debajo del umbral.
- 2Diagnosticar: investigar la causa raíz. ¿Ha cambiado algo en el sistema origen? ¿Hay un proceso manual que ha fallado? ¿Se ha modificado un pipeline?
- 3Corregir: arreglar los datos afectados y el proceso que causó el problema.
- 4Prevenir: ajustar validaciones, añadir controles en la fuente o automatizar la detección para que no se repita.
Si necesitas ayuda para diseñar e implementar un marco de calidad de datos, puedes ver cómo lo abordamos en nuestra página de gobierno del dato y calidad o contactarnos para una evaluación inicial.
Para más información, puedes consultar la informe de Gartner sobre datos listos para IA.
Preguntas frecuentes
¿Necesito una herramienta específica para medir calidad de datos?
No necesariamente. Puedes empezar con consultas SQL que calculen los KPIs sobre tus tablas principales. A medida que escalas, herramientas como Great Expectations o Soda facilitan la automatización y la gestión de reglas. La herramienta llega después de tener claras las métricas y los umbrales.
¿Cómo convenzo a dirección de que esto merece inversión?
Conecta la calidad de datos con dinero. Cuántas horas se dedican a limpiar datos manualmente. Cuántas decisiones se han tomado con cifras erróneas. Cuántos informes se han rehecho por duplicados o inconsistencias. Cuando el coste de la mala calidad se cuantifica, la inversión se justifica sola.
¿Los KPIs de calidad aplican a datos no estructurados?
Los seis KPIs están pensados para datos estructurados (tablas, registros, campos). Para datos no estructurados (documentos, imágenes, texto libre), se aplican métricas diferentes: actualización del documento, formato accesible, cobertura temática. Si tu foco es preparar datos no estructurados para IA, lo cubrimos en datos listos para IA: calidad como requisito.
¿Cuántos KPIs de calidad de datos debería medir?
Empieza con los que tengan impacto directo en tus procesos críticos. Para la mayoría de empresas, completitud, unicidad y oportunidad son los tres primeros. Cuando esos estén estabilizados, añade exactitud, consistencia y validez. Medir los seis desde el día uno sin capacidad para actuar sobre ellos genera ruido sin valor.
¿Con qué frecuencia debo revisar los KPIs de calidad?
Depende de la cadencia de tus datos. Si los datos se actualizan diariamente, las métricas deberían calcularse diariamente. Si son mensuales, una revisión mensual basta. Lo que no funciona es medir una vez al año: los problemas de calidad aparecen gradualmente y se corrigen mejor cuando se detectan pronto.
¿Qué herramientas puedo usar para medir calidad de datos?
Great Expectations y Soda son las más populares en entornos open source. dbt tiene tests de datos integrados. Herramientas de BI como Power BI permiten crear dashboards de calidad sobre consultas SQL. Para entornos enterprise, Informatica, Talend y Ataccama ofrecen suites completas. La herramienta importa menos que tener las reglas definidas.
¿Qué pasa si un KPI cae por debajo del umbral?
Debería activar un proceso de investigación y corrección: identificar la fuente del problema (carga errónea, cambio en el sistema origen, error humano), corregir los datos afectados y ajustar el pipeline o el proceso para que no vuelva a ocurrir. Si no hay un proceso de respuesta definido, medir no sirve de mucho.
¿La calidad de datos es responsabilidad de TI o de negocio?
De ambos. TI proporciona las herramientas, los pipelines y la automatización. Negocio define qué significa que un dato sea correcto, establece los umbrales aceptables y actúa cuando la calidad baja. Sin esa corresponsabilidad, la calidad acaba siendo un tema que nadie prioriza.
Siguiente paso recomendado
Gobierno del dato y calidad
Definimos y monitorizamos los KPIs de calidad correctos para tu empresa.
Sin compromiso · Respuesta en < 24h
Autor
Fundador y Consultor de Datos e IA
David Aldomar es fundador y consultor principal de MERIDIAN Data & IA, consultora especializada en ayudar a pymes y empresas medianas en España a tomar mejores decisiones con sus datos. Su trabajo se centra en cuatro áreas: diseño e implantación de plataformas de datos (data warehouses, pipelines ETL con dbt, integración de ERPs y CRMs), reporting y dashboards ejecutivos en Power BI, automatización de procesos de negocio con herramientas como n8n, y desarrollo de soluciones de inteligencia artificial aplicada — desde modelos de forecasting de demanda hasta copilots internos basados en RAG con LangChain y FastAPI. Ha liderado proyectos en sectores como logística y transporte, retail y distribución, servicios financieros, manufacturing y construcción, siempre con un enfoque pragmático: diagnóstico corto, entregables concretos y transferencia de conocimiento al equipo del cliente para que sea autónomo desde el primer día. Antes de fundar MERIDIAN, trabajó como ingeniero de datos y BI en entornos empresariales reales: arquitecturas Data Warehouse por capas (Bronze/Silver/Gold), pipelines ETL/ELT en AWS (S3, Glue, Redshift Serverless, Athena) y stacks Microsoft (SQL Server, Power BI, Azure), integrando fuentes tan dispares como ERPs, CRMs y bases de datos operacionales — PostgreSQL, MariaDB — en una única fuente fiable para negocio, finanzas y reporting. Tiene un Máster en Ciencia de Datos e Ingeniería del Dato en la Nube. Su filosofía es que un buen proyecto de datos no se mide por la tecnología que usa, sino por las decisiones de negocio que permite tomar. Escribe regularmente en el blog de MERIDIAN sobre reporting, gobierno del dato, automatización e IA aplicada, con guías prácticas orientadas a responsables de negocio y equipos técnicos de empresas que quieren sacar partido real a sus datos sin depender de grandes consultoras.
Fuentes
Contenido y servicios relacionados
- Gobierno del dato y calidad
Diseño e implantación de marcos de gobernanza y calidad de datos adaptados a tu empresa.
- Calidad de datos en informes de Power BI
Cómo la calidad de los datos afecta a tus informes de BI y qué controles aplicar.
- Calidad de datos en pipelines ETL
Dónde y cómo integrar validaciones de calidad dentro de tus pipelines de datos.
- Datos listos para IA: calidad como requisito
Qué nivel de calidad necesitan tus datos antes de alimentar modelos de inteligencia artificial.
- Implementar gobierno del dato paso a paso
Con el gobierno en marcha, define los KPIs de calidad correctos.
- Auditoría calidad datos BI
Lectura complementaria sobre calidad de datos BI.
- Auditoría de gobierno del dato
Diagnóstico de calidad, ownership y cumplimiento RGPD y AI Act en 2-3 semanas.
- Gobierno del dato en empresa: guía 2026
Guía de gobierno del dato: ownership, calidad, catálogo, MDM, RGPD y AI Act. Cómo implantarlo sin burocracia.
