
- La plataforma DAQU usará modelos de lenguaje de gran escala (LLMs) para normalizar, depurar, validar y enriquecer los datos maestros y señales de sensores industriales, con trazabilidad completa. El proyecto se desarrollará junto a CMPC Pulp como entidad asociada y busca resolver el principal cuello de botella de la adopción de la IA en minería, celulosa, manufactura y energía: la baja calidad de los datos.
El Centro Nacional de Inteligencia Artificial (CENIA) se adjudicó un proyecto en el concurso FONDEF IDeA I+D 2026 de ANID, convocatoria que este año recibió 871 postulaciones y seleccionó 102 iniciativas a nivel nacional —cerca del 12% de las propuestas presentadas—, orientadas a desarrollar tecnologías con potencial de transferencia al sector productivo, público o social.
La iniciativa adjudicada es DAQU (Data Quality Improvement Platform Through LLMs), una plataforma de mejora de la calidad de datos industriales que CENIA desarrollará durante 24 meses en colaboración con CMPC Pulp como entidad asociada.
El problema: más datos, peores decisiones
La transformación digital de las industrias intensivas en activos —minería, celulosa y papel, manufactura, energía, petróleo y gas— ha multiplicado el volumen de datos disponibles, pero no su calidad. La consultora Gartner estima que los problemas de calidad de los datos cuestan a las organizaciones cerca del 15% de sus ingresos anuales, y McKinsey reporta que más del 60% de las iniciativas de IA en manufactura fracasan principalmente por esta causa.
En minería se estima que entre 10% y 20% de los ítems de bodega está duplicado o mal clasificado, y más de la mitad de las organizaciones reporta detenciones relevantes de mantenimiento originadas en problemas de datos de MRO. A ello se suman millones de SKU no normalizados, registros duplicados de proveedores, una criticidad de repuestos no definida y errores sistemáticos de codificación. En el plano de los sensores industriales, las brechas de disponibilidad, el ruido, los valores atípicos y la falta de trazabilidad degradan directamente los sistemas de mantenimiento predictivo y de control basados en IA.
La paradoja es conocida en la industria: mientras más datos se acumulan, menos confiables se vuelven los modelos que se alimentan de ellos.
“Hoy, el mayor obstáculo para que la Inteligencia Artificial funcione en la industria no está en los modelos, sino en los datos que los alimentan. DAQU ataca ese problema de raíz: automatiza la limpieza y el enriquecimiento con LLMs, pero mantiene al experto en el circuito y deja registrada la trazabilidad de cada transformación”, explica Yamisleydi Salgueiro, directora del proyecto e investigadora asociada de CENIA.
Qué es DAQU
DAQU es una plataforma que abarca todo el ciclo de preparación de datos: normalización, deduplicación, validación, enriquecimiento y extracción automática de reglas, tanto para datos maestros (SKU, proveedores, repuestos) como para flujos de datos de sensores industriales, manteniendo la trazabilidad completa de cada transformación.
Su arquitectura contempla dos modalidades de uso: SaaS, que se integra mediante APIs y conectores con sistemas ERP, MES, SCADA y data lakes existentes, permitiendo el procesamiento por lotes o en tiempo real, y DaaS, en la que la organización accede a datos ya procesados y enriquecidos mediante integraciones seguras. La plataforma está diseñada para tres perfiles de usuario: los equipos de mantenimiento y operaciones, que necesitan catálogos de repuestos confiables y señales de sensores sin brechas para sostener sus planes de mantenimiento; los equipos de compras y abastecimiento, que trabajan con SKU no normalizados, proveedores duplicados y una criticidad de repuestos no definida; y los equipos de ciencia de datos e IA, que hoy pasan la mayor parte de su tiempo preparando datos en vez de construir modelos.
Lo que distingue a DAQU de las herramientas comerciales de calidad de datos, basadas mayoritariamente en reglas configuradas manualmente, es la combinación de enriquecimiento semántico asistido por LLMs, generación automática de reglas, conocimiento específico del dominio industrial y validación humana experta, todo ello sobre una capa de trazabilidad auditable.
El proyecto contempla el desarrollo del MVP mediante co-creación con el socio industrial, pilotos en entornos productivos reales y un mecanismo de transferencia que permita escalar la solución a otras empresas del sector.
El punto de partida
El proyecto se apoya en trabajo previo desarrollado con CMPC Pulp sobre datos maestros industriales, que verificó la factibilidad de combinar modelos de lenguaje, fuentes web y documentación técnica para normalizar y enriquecer registros. De ahí surge una definición de diseño que atraviesa toda la plataforma: la validación del experto de dominio sobre las propuestas del sistema eleva la calidad del resultado sin sacrificar la escala de la automatización.
Colaboración con CMPC Pulp
CMPC Pulp participa como entidad asociada aportando experticia de dominio, conjuntos de datos históricos anonimizados (inventarios, SKU, sensores de proceso), criterios de validación basados en requerimientos operacionales y el alojamiento de los pilotos en sus instalaciones. CENIA lidera la dirección científica, el rigor metodológico y la validación experimental.
El modelo de trabajo es de co-creación continua: equipos mixtos de académicos, científicos de datos, ingenieros de software, expertos de dominio y personal de operaciones, con revisiones técnicas semanales y sesiones de alineamiento estratégico mensuales. Entre los resultados comprometidos están la formalización de un acuerdo específico de transferencia de conocimiento entre CENIA y CMPC Pulp, y la construcción de un marco de colaboración de largo plazo con una red ampliada de empresas intensivas en activos en Chile y América Latina.
“Trabajamos con millones de registros y miles de sensores; cada mejora en la confiabilidad de esos datos se traduce en mejores decisiones de mantenimiento, abastecimiento y planificación. Colaborar con CENIA nos permite abordar ese desafío mediante investigación aplicada y validación rigurosa en nuestras propias operaciones”, señala Salvador Flores, Head of AI & Advanced Analytics de CMPC.
Formación de capital humano y producción científica
El proyecto incorpora estudiantes que desarrollarán sus tesis en temas de pipelines de normalización y limpieza, prototipado de la interfaz de la plataforma, enriquecimiento semántico y ontologías para datos industriales, y evaluación de métodos de extracción de reglas basados en LLMs. Se suman ingenieros e ingenieras de Machine Learning que se especializarán en el diseño, implementación y validación de modelos avanzados de calidad de datos, bajo mentoría de investigadores senior y expertos de la industria.
La iniciativa se enmarca en la Estrategia Nacional de Inteligencia Artificial y en los objetivos de transformación digital del país.
El equipo del proyecto está conformado por Yamisleydi Salgueiro Sicilia, directora del proyecto e investigadora principal de CENIA; Diego Rios, director alterno y líder técnico; Gonzalo Nápoles, investigador y consultor internacional de la Universidad de Tilburg (Países Bajos); Cristián Tamblay y Patricio Espinoza, responsables de los componentes de IA y despliegue de la solución; Juan Ignacio Stark, a cargo de innovación y transferencia; Jorge Pedro Castillo Carrillo, encargado de desarrollo de negocios internacional, y Matías Sánchez Cabeza, asesor técnico en minería y gestión de activos.




