Data Intelligence para AWS

Entiende cómo se mueve tu dato.

Plataforma asistida por IA que descubre tus recursos AWS en modo solo lectura, analiza los procesos y construye el linaje de datos explicable: del proceso a la tabla y, cuando hay evidencia, a la columna.

Read-only discovery AWS-first AI-assisted Human validation

RUTA S3 s3://raw/orders/ TABLA curated.accounts RUTA S3 s3://raw/events/ GLUE JOB glue-orders-curated 92% LAMBDA fn-events-enrich 87% TABLA curated.crm_orders TABLA ready.customer_360 RUTA S3 s3://ready/events/ REDSHIFT dwh.sales_fact ATHENA vw_events_daily
11 relaciones validadas Column-level lineage
  • AWS-first
  • Read-only discovery
  • Column lineage
  • AI-assisted analysis
  • Human validation
  • Impact analysis

El problema

Tu plataforma de datos cambia más rápido que su documentación.

El lineage manual envejece en cuanto alguien despliega un job nuevo. Y cuando el conocimiento vive en unas pocas personas, cada cambio se convierte en una conversación en lugar de una consulta.

  • ¿De dónde viene este dato?
  • ¿Qué proceso genera esta tabla?
  • ¿Qué se rompe si modificamos esta columna?
  • ¿Quién consume este dataset?
  • ¿Este pipeline sigue utilizándose?
  • ¿Podemos confiar en el linaje que tenemos?

Arquitecturas difíciles de leer

Decenas de jobs, funciones y buckets sin una vista única que los relacione.

Dependencias invisibles

Tablas y datasets compartidos entre procesos que nadie ha inventariado.

Documentación desactualizada

Diagramas correctos el día que se dibujaron y obsoletos al despliegue siguiente.

Cambios con impacto desconocido

Modificar un esquema exige preguntar por Slack en lugar de consultar el linaje.

Cómo funciona

De recursos AWS a linaje en el que confiar

Cinco etapas. Tú decides qué se analiza y qué se publica.

  1. 01

    Discover

    Conexión de solo lectura a tu entorno AWS para descubrir recursos y detectar procesos candidatos.

  2. 02

    Select

    Eliges los procesos, cuentas y regiones que quieres analizar. Nada se analiza sin selección previa.

  3. 03

    Analyze

    La IA analiza código, SQL, configuración, parámetros y dependencias del proceso seleccionado.

  4. 04

    Validate

    Revisas confianza y evidencia de cada relación: confirmar, rechazar o dejar pendiente.

  5. 05

    Explore

    Publicas el linaje y lo exploras con grafo, impacto, detalle de proceso y Copilot.

El producto

From discovery to trusted lineage.

Un flujo continuo: escaneo, extracción, validación y exploración sobre la misma base de conocimiento.

Linaje de datos · acme-datalake · 111122223333 · eu-south-2 · DEV
Tipo: todos Dirección: ambos Profundidad: 2 Confianza mín. 80% Mostrar columnas

Vistas del producto sobre un entorno de demostración. La cuenta, los procesos y los nombres de tablas y datasets son ficticios.

Capacidades

Cuatro pilares, una misma base de conocimiento

Discover

Inventario del ecosistema AWS sin modificar tus recursos.

  • AWS resource discovery
  • Inventario por cuenta y región
  • Detección de procesos candidatos

Understand

Relaciones reales entre procesos, tablas, datasets y rutas S3.

  • Process lineage
  • Table & dataset lineage
  • Column lineage con evidencia
  • Transformaciones detectadas

Trust

Cada relación llega con su nivel de confianza y su evidencia.

  • Confianza por relación
  • Evidencia trazable al código
  • Revisión humana
  • Publicación controlada

Explore

Navega el ecosistema y pregunta en lenguaje natural.

  • Grafo global
  • Upstream / downstream
  • Impact analysis
  • AI Data Copilot

Column-level lineage

Hasta la columna, cuando hay evidencia suficiente

Cuando el código y el SQL lo permiten, el análisis desciende a nivel de columna e identifica el tipo de transformación. Cuando la evidencia no es suficiente, la relación se marca como tal en lugar de darse por buena.

  • direct
  • rename
  • cast
  • calculation
  • join
  • aggregation
  • + otros patrones detectables

curated.crm_orders

  • order_id
  • customer_name
  • order_ts
  • amount

ready.customer_360

  • order_id
  • client
  • order_date
  • total_amount

Casos de uso

Para qué se usa dentro de un equipo de datos

Impact analysis

Conoce qué puede romperse antes de modificar una tabla, una columna o un job.

Data governance

Comprende origen, destino y transformación de la información que gobiernas.

Architecture discovery

Documenta una plataforma AWS existente sin partir de diagramas manuales.

Troubleshooting

Sigue dependencias y productores de datos para llegar al origen del problema.

Modernization

Entiende los sistemas actuales antes de migrarlos, consolidarlos o refactorizarlos.

Audit & compliance

Aporta trazabilidad y evidencia sobre cómo circula la información entre sistemas.

¿Reconoces alguno de estos escenarios en tu plataforma?

Solicitar demo

Plataforma configurable

Una plataforma que se adapta a tu arquitectura

No imponemos una arquitectura única. El core del producto es común; las reglas de análisis, integraciones y despliegue se ajustan a cómo trabajas.

Core product

Lo que obtienes desde el primer escaneo

  • Discovery AWS de solo lectura
  • Extracción de linaje asistida por IA
  • Confianza, evidencia y revisión
  • Grafo, detalle de proceso y Copilot

Configurable capabilities

Lo que ajustamos a tu entorno

  • Servicios AWS
  • Convenciones de nombrado
  • Modelos de datos
  • Patrones ETL / ELT
  • Reglas de análisis
  • Fuentes adicionales
  • Necesidades de gobierno
  • Modelo de despliegue
  • Integraciones

Se puede adoptar como producto, como acelerador de un proyecto de gobierno o como plataforma configurada para un entorno concreto.

Qué hace exactamente la IA

AI-assisted. Human-trusted.

Los metadatos no siempre contienen la relación: muchas veces está escrita en el código, en el SQL o en la configuración del job. La IA lee esos artefactos e infiere la relación, y deja por escrito en qué se basa.

Cada relación propuesta lleva confianza y evidencia, y pasa por revisión antes de publicarse. Sin caja negra.

Confidence Evidence Human review
  1. Code + metadataPython, SQL, configuración, parámetros, dependencias
  2. AI analysisInferencia de fuentes, destinos y transformaciones
  3. LineageProcesos, tablas, datasets, rutas S3, columnas
  4. Evidence + confidenceReferencia al artefacto y nivel de certeza
  5. Human validationConfirmar, rechazar o dejar pendiente antes de publicar

Roadmap

Data lineage es solo el principio.

El mismo conocimiento técnico que permite construir el linaje habilita otros servicios sobre la plataforma. Separamos con claridad lo que existe hoy de lo que está en roadmap.

Disponible hoy

  • Discovery de recursos AWS (solo lectura)
  • Process lineage
  • Tablas, datasets y rutas S3
  • Transformaciones detectadas
  • Column lineage cuando hay evidencia
  • Confianza y evidencia por relación
  • Revisión y publicación
  • Exploración por grafo
  • AI Data Copilot

Próximas capacidades · roadmap

  • A

    Pipeline intelligence Roadmap

    Analizar jobs, funciones y SQL para señalar complejidad, redundancias, código duplicado y transformaciones costosas.

  • B

    Automated technical documentation Roadmap

    Generar descripción funcional, entradas, salidas, transformaciones y diagramas, y mantenerlos sincronizados con cada escaneo.

  • C

    Technical debt analysis Roadmap

    Detectar pipelines sin consumidores, procesos duplicados, activos obsoletos y dependencias críticas.

  • D

    Data change intelligence Roadmap

    Comparar escaneos para identificar nuevos procesos, recursos eliminados, cambios de esquema y su impacto potencial.

  • E

    Data quality intelligence Coming next

    Enlazar un problema de calidad con el dataset, el proceso productor y la fuente para acelerar el root-cause analysis.

  • F

    FinOps for data pipelines Roadmap

    Cruzar arquitectura y ejecución para localizar procesos sobredimensionados, jobs redundantes y recursos infrautilizados.

  • G

    Automated test generation Future capability

    Proponer tests SQL, validaciones de contrato, tests de regresión y data quality checks a partir del linaje.

  • H

    Modernization assessment Roadmap

    Evaluar plataformas existentes con IA y linaje antes de migrar, refactorizar, consolidar o retirar procesos.

  • I

    Data knowledge graph Visión

    Evolucionar el linaje hacia un grafo de conocimiento que conecte datos, documentación, owners, calidad, coste, políticas e incidencias.

Las capacidades marcadas como roadmap no están disponibles todavía y su alcance puede cambiar. Si alguna es prioritaria para tu equipo, cuéntanoslo.

Seguridad

Diseñado con la seguridad enterprise en mente

Discovery de solo lectura

El descubrimiento no modifica recursos de tu cuenta AWS.

Análisis bajo selección

Sólo se analizan los procesos que tú seleccionas explícitamente.

Control del alcance

Tú decides cuentas, regiones, entornos y procesos incluidos en cada escaneo.

Integración flexible

Arquitectura preparada para distintos modelos de integración y despliegue.

Preferimos ser explícitos: hoy no reclamamos certificaciones ni sellos de cumplimiento. Los requisitos concretos de seguridad, despliegue y tratamiento de datos se revisan caso por caso durante la evaluación.

Modelo de adopción

Empieza por un dominio. Extiende cuando aporte valor.

El producto está en fase de validación con las primeras organizaciones. Eso significa acceso directo a quien lo construye y prioridades que entran en el roadmap de verdad.

01

Pilot

Analizamos un dominio o un conjunto limitado de pipelines para validar el valor con tu propio linaje.

02

Scale

Extensión progresiva a más cuentas, regiones, entornos y procesos.

03

Customize

Ajuste de reglas de análisis, integraciones y capacidades a necesidades particulares.

Cuéntanos tu arquitectura y evaluamos el encaje.

Hablemos de tu caso

Preguntas frecuentes

Linaje de datos en AWS, explicado

¿Qué es el linaje de datos?

El linaje de datos, o data lineage, es el registro de cómo se mueve y se transforma la información entre sistemas: de qué fuente viene un dato, qué proceso lo lee, qué transformaciones sufre y en qué tabla o dataset acaba. Permite responder preguntas de impacto y de gobierno del dato sin depender del conocimiento de una persona concreta.

¿Cómo se documenta el linaje de datos en una plataforma AWS?

De forma manual se hace con diagramas y hojas de cálculo que envejecen en cuanto alguien despliega un job nuevo. AI Data Lineage Mapper lo obtiene del propio entorno: descubre los recursos de la cuenta en modo solo lectura, analiza el código y el SQL de los procesos que selecciones, y construye las relaciones entre Glue Jobs, funciones Lambda, Step Functions, tablas del Glue Data Catalog, rutas de Amazon S3, Redshift y Athena.

¿Qué es el linaje a nivel de columna?

Es el linaje que baja del nivel de tabla al de campo: qué columna de origen alimenta cada columna de destino y con qué transformación (direct, rename, cast, calculation, join o aggregation). Se identifica cuando el código y el SQL contienen evidencia suficiente; cuando no la hay, la relación se marca como tal en lugar de darse por buena.

¿Cómo saber qué procesos leen o escriben una tabla?

Con el linaje publicado se consulta en el grafo o se pregunta al Copilot en lenguaje natural. Para cualquier tabla, dataset o ruta S3 puedes ver sus procesos productores y consumidores, y recorrer el linaje aguas arriba y aguas abajo tantos niveles como necesites.

¿Cómo hacer un análisis de impacto antes de modificar una tabla o una columna?

El análisis de impacto recorre el linaje hacia abajo desde el activo que quieres cambiar y lista los procesos, tablas y datasets que dependen de él. Así sabes qué puede romperse antes de tocar un esquema, en lugar de preguntarlo por chat y esperar a que alguien recuerde la respuesta.

¿Es fiable un linaje extraído con inteligencia artificial?

Cada relación se propone con un nivel de confianza y la evidencia concreta en la que se basa: fichero y línea del código, sentencia SQL o parámetro del job. Después pasa por revisión humana antes de publicarse, y puede confirmarse, rechazarse o quedar pendiente. La IA propone y una persona decide, así que no hay caja negra.

¿Necesita permisos de escritura en mi cuenta de AWS?

No. El descubrimiento se realiza en modo solo lectura y no modifica ningún recurso de tu cuenta. Además, únicamente se analizan los procesos que selecciones de forma explícita, y tú decides qué cuentas, regiones y entornos entran en cada escaneo.

Contacto

Hablemos de tu plataforma de datos.

Cada arquitectura es diferente. Cuéntanos qué quieres entender, documentar, optimizar o gobernar y evaluaremos cómo adaptar la plataforma a tu entorno.

  • Revisión técnica de tu caso, sin compromiso
  • Demo sobre el producto real
  • Propuesta de piloto acotado