Data Intelligence para AWS

Entiende de dónde viene cada dato y qué se rompe si cambia.

TrustedLineage descubre tus recursos AWS en modo solo lectura y construye linaje explicable, con evidencia y confianza desde el proceso hasta la columna.

  • Read-only discovery
  • AWS-first
  • AI-assisted
  • Human validation
Diagrama de linaje de datos desde fuentes AWS hasta tablas de destino, con evidencia y nivel de confianza.
Visualización del producto con datos de demostración.
  • AWS-first
  • Read-only discovery
  • Column lineage
  • AI-assisted analysis
  • Human validation
  • Impact analysis

El problema

Tu plataforma de datos cambia más rápido que su documentación.

El lineage manual envejece en cuanto alguien despliega un job nuevo. Y cuando el conocimiento vive en unas pocas personas, cada cambio se convierte en una conversación en lugar de una consulta.

Respuesta

El grafo recorre el linaje hacia arriba hasta la fuente: qué proceso escribió la tabla, desde qué ruta S3 o tabla leyó, y con qué evidencia se dedujo cada salto.

Qué lo resuelve Explore · grafo de linaje

Arquitecturas difíciles de leer

Decenas de jobs, funciones y buckets sin una vista única que los relacione.

Dependencias invisibles

Tablas y datasets compartidos entre procesos que nadie ha inventariado.

Documentación desactualizada

Diagramas correctos el día que se dibujaron y obsoletos al despliegue siguiente.

Cambios con impacto desconocido

Modificar un esquema exige preguntar por Slack en lugar de consultar el linaje.

Cómo funciona

De recursos AWS a linaje en el que confiar

Cinco etapas. Tú decides qué se analiza y qué se publica.

01 / 05

Discover

Conexión de solo lectura a tu entorno AWS para descubrir recursos y detectar procesos candidatos.

El producto

Del descubrimiento a un linaje de confianza.

Un flujo continuo: escaneo, extracción, validación y exploración sobre la misma base de conocimiento. Estas son las pantallas del producto, no un concepto.

Tres recorridos para empezar. Las nueve áreas siguen disponibles.

Inventario del ecosistema AWS sin modificar tus recursos.

  • AWS resource discovery
  • Inventario por cuenta y región
  • Detección de procesos candidatos
AI Data Lineage Mapper
DataLake Intelligence Copilot

Dashboard

Resumen de cobertura, calidad y estado del linaje

Cuenta: acme-datalake Región: eu-south-2 Entorno: DEV Último escaneo: hoy, 16:34 COMPLETADO

Recursos descubiertos

259

▲ +125 vs. escaneo previo

Procesos detectados

61

▼ -21 vs. escaneo previo

Procesos con linaje

47

de 61 totales

Cobertura de linaje

77%

▲ +14 p.p. vs. previo

Confianza media

89%

confianza del proceso

Servicios detectados

6

▲ +3 vs. escaneo previo

Estado del linaje

61
Procesos totales
  • Con linaje validado 47 (77 %)
  • Con linaje no validado 9 (15 %)
  • Extracción en curso 2 (3 %)
  • Error de extracción 1 (2 %)
  • Sin linaje extraído 2 (3 %)
Ver todos los procesos →

Calidad del linaje

  • Relaciones totales 170
  • Confirmadas 142 (84 %)
  • Pendientes 24
  • Rechazadas 4
  • Baja confianza (<85 %) 18

Cobertura por tipo de recurso (nº de relaciones)

  • Tablas159
  • Columnas43
  • Procesos9
  • Almacenes14
Ver calidad de linaje →

Tendencia de cobertura

Últimos 7 escaneos

Requiere atención

4 alertas
  • Procesos con error de extracción 1
  • Procesos sin linaje extraído 2
  • Relaciones pendientes de revisar 24
  • Relaciones con baja confianza 18

Últimos escaneos

hoy, 16:34 COMPLETADO

111122223333 / eu-south-2 / DEV

Procesos

61

Con linaje

47

Confianza

89 %

Ver detalle →

Cambios recientes

  • Relación validada hace 2 h
  • Relación validada hace 5 h
  • Relación rechazada ayer
Ver historial →

✦ Copilot (Linaje)

Ver historial

Haz una pregunta sobre el linaje…

✦ ¿Qué procesos tienen baja confianza?

✦ ¿Qué procesos no tienen linaje extraído?

✦ ¿Qué cambió en el último escaneo?

✦ ¿Cuáles son los activos más críticos?

Recursos destacados

Ver todos →
  • ready.customer_360Tabla
  • glue-orders-curatedGlue Job
  • s3://acme-raw/orders/Ruta S3

Mapa resumido de la plataforma

Ver mapa completo
  • Fuentes externas4
  • Amazon S314
  • AWS Glue Jobs28
  • AWS Athena0
  • Amazon Redshift96

AWS Glue Jobs → Redshift: 156 relaciones · Amazon S3 → Redshift: 12 relaciones. Ruta directa sin pasar por Athena.

Cada alerta es un enlace: lleva a la lista de procesos o relaciones que la producen, no a un informe que haya que interpretar.

Vistas del producto sobre un entorno de demostración. La cuenta, los procesos y los nombres de tablas y datasets son ficticios.

Column-level lineage

Hasta la columna, cuando hay evidencia suficiente

Cuando el código y el SQL lo permiten, el análisis desciende a nivel de columna e identifica el tipo de transformación. Cuando la evidencia no es suficiente, la relación se marca como tal en lugar de darse por buena.

  • direct
  • rename
  • cast
  • calculation
  • join
  • aggregation
  • + otros patrones detectables

Cuatro relaciones detectadas entre las dos tablas. Elige una para ver de qué tipo es.

curated.crm_orders

ready.customer_360

direct order_id → order_id

La columna se copia sin transformar. Es la relación más fácil de sostener: el SELECT la nombra igual en origen y en destino.

Casos de uso

Para qué se usa dentro de un equipo de datos

Qué te deja responder

¿Qué se rompe si toco esta tabla o esta columna?

Conoce qué puede romperse antes de modificar una tabla, una columna o un job.

¿Reconoces alguno de estos escenarios en tu plataforma?

Solicitar demo

Seguridad e IA

Diseñado con la seguridad enterprise en mente

  • Descubrimiento de solo lectura

    La conexión a tu cuenta AWS es de solo lectura: descubre recursos y procesos sin modificar nada, y solo se analiza lo que tú seleccionas.

  • El contenido de tus tablas no se analiza

    Filas, muestras y contenido de columnas no entran en el análisis ni salen de tu cuenta. Se analiza cómo se mueve el dato, no el dato.

  • El modelo, donde tú decidas

    Ollama en local, sin que nada salga de tu red, o Claude u OpenAI bajo una política de salida declarada clase de dato por clase de dato.

Preferimos ser explícitos: hoy no reclamamos certificaciones ni sellos de cumplimiento, y el acceso es con usuarios propios del producto, no con vuestro SSO corporativo todavía. Los requisitos concretos de seguridad, despliegue y tratamiento de datos se revisan caso por caso durante la evaluación.

Ver detalles técnicos Conexión y acceso, qué hace la IA, proveedores y la matriz completa de salida de datos.

Conexión y acceso a tu cuenta AWS

Análisis bajo selección

Sólo se analizan los procesos que tú seleccionas explícitamente.

Control del alcance

Tú decides cuentas, regiones, entornos y procesos incluidos en cada escaneo.

Creas un rol de solo lectura en tu cuenta con la trust policy que te proporciona el producto, protegido con ExternalId. No se almacenan credenciales de tu cuenta: se asume el rol para cada operación.

En ambos casos

Permisos verificados

Cada conexión se valida y muestra qué puede hacer y qué no: descubrimiento, Glue Jobs, catálogo, Lambda, Step Functions o lectura de código en S3. Si falta un permiso, se ve antes de escanear en lugar de fallar a mitad.

Modelo de adopción

Empieza por un dominio. Extiende cuando aporte valor.

El producto está en fase de validación con las primeras organizaciones. Eso significa acceso directo a quien lo construye y prioridades que entran en el roadmap de verdad.

01

Pilot

Analizamos un dominio o un conjunto limitado de pipelines para validar el valor con tu propio linaje.

02

Scale

Extensión progresiva a más cuentas, regiones, entornos y procesos.

03

Customize

Ajuste de reglas de análisis, integraciones y capacidades a necesidades particulares.

Una plataforma que se adapta a tu arquitectura No imponemos una arquitectura única. El core del producto es común; las reglas de análisis, integraciones y despliegue se ajustan a cómo trabajas.

Lo que obtienes desde el primer escaneo

  • Discovery AWS de solo lectura
  • Extracción de linaje asistida por IA
  • Confianza, evidencia y revisión
  • Grafo, detalle de proceso y Copilot
  • Usuarios, roles y alcance por cuenta

Lo que ajustamos a tu entorno

  • Proveedor del modelo de IA
  • Assume Role o appliance
  • Objetivo de confianza
  • Profundidad del análisis
  • Servicios AWS
  • Cuentas, regiones y entornos
  • Convenciones de nombrado
  • Patrones ETL / ELT
  • Necesidades de gobierno
  • Roles y alcance por conexión
  • Política de salida de datos
  • Integraciones

El linaje se persiste en PostgreSQL como fuente de verdad y, opcionalmente, se sincroniza el grafo en Neo4j. Se puede adoptar como producto, como acelerador de un proyecto de gobierno o como plataforma configurada para un entorno concreto.

Cuéntanos tu arquitectura y evaluamos el encaje.

Evaluar un piloto

Roadmap

Data lineage es solo el principio.

El mismo conocimiento técnico que permite construir el linaje habilita otros servicios sobre la plataforma. Separamos con claridad lo que existe hoy de lo que está en roadmap.

  • Discovery de recursos AWS (solo lectura)
  • Process lineage
  • Tablas, datasets y rutas S3
  • Transformaciones detectadas
  • Column lineage cuando hay evidencia
  • Confianza y evidencia por relación
Ver las 15 capacidades disponibles
  • Revisión y publicación
  • Modelo de IA local o en API externa
  • Catálogo e inventario con dominio y owner
  • Documentación por recurso en Markdown
  • Exploración por grafo
  • AI Data Copilot
  • Usuarios, tres roles y alcance por cuenta AWS
  • Política declarada de salida de datos
  • Conexión multicuenta con ExternalId verificado

Fuera de esto: el acceso es con usuarios del propio producto. La integración con un directorio corporativo —SSO, SAML u OIDC— está prevista y la autorización ya está construida para no depender de cómo te autentiques, pero hoy no está.

Las capacidades marcadas como roadmap no están disponibles todavía y su alcance puede cambiar. Si alguna es prioritaria para tu equipo, cuéntanoslo.

Preguntas frecuentes

Linaje de datos en AWS, explicado

¿Qué es el linaje de datos?

El linaje de datos, o data lineage, es el registro de cómo se mueve y se transforma la información entre sistemas: de qué fuente viene un dato, qué proceso lo lee, qué transformaciones sufre y en qué tabla o dataset acaba. Permite responder preguntas de impacto y de gobierno del dato sin depender del conocimiento de una persona concreta.

¿Cómo se documenta el linaje de datos en una plataforma AWS?

De forma manual se hace con diagramas y hojas de cálculo que envejecen en cuanto alguien despliega un job nuevo. AI Data Lineage Mapper lo obtiene del propio entorno: descubre los recursos de la cuenta en modo solo lectura y analiza el código, el SQL y la configuración de los procesos que selecciones. Los procesos que se analizan para extraer linaje son Glue Jobs, funciones Lambda y Step Functions, y las relaciones resultantes conectan tablas del Glue Data Catalog, rutas de Amazon S3 y objetos de Redshift.

¿Qué es el linaje a nivel de columna?

Es el linaje que baja del nivel de tabla al de campo: qué columna de origen alimenta cada columna de destino y con qué transformación (direct, rename, cast, calculation, join o aggregation). Se identifica cuando el código y el SQL contienen evidencia suficiente; cuando no la hay, la relación se marca como tal en lugar de darse por buena.

¿Cómo saber qué procesos leen o escriben una tabla?

Con el linaje publicado se consulta en el grafo o se pregunta al Copilot en lenguaje natural. Para cualquier tabla, dataset o ruta S3 puedes ver sus procesos productores y consumidores, y recorrer el linaje aguas arriba y aguas abajo tantos niveles como necesites.

¿Cómo hacer un análisis de impacto antes de modificar una tabla o una columna?

El análisis de impacto recorre el linaje hacia abajo desde el activo que quieres cambiar y lista los procesos, tablas y datasets que dependen de él. Así sabes qué puede romperse antes de tocar un esquema, en lugar de preguntarlo por chat y esperar a que alguien recuerde la respuesta.

¿Es fiable un linaje extraído con inteligencia artificial?

Cada relación se propone con un nivel de confianza y la evidencia concreta en la que se basa: fichero y línea del código, sentencia SQL o parámetro del job. Después pasa por revisión humana antes de publicarse, y puede confirmarse, rechazarse o quedar pendiente. La IA propone y una persona decide, así que no hay caja negra.

¿El análisis con IA envía el código de mis procesos a un servicio externo?

Solo si tú lo eliges. El proveedor del modelo se configura en cada extracción: puedes usar Ollama ejecutándose en tu propia infraestructura, y entonces ni el código ni el SQL salen de tu red, o las APIs de Anthropic u OpenAI si prefieres su capacidad. La decisión es explícita y se toma antes de lanzar el análisis.

¿Necesita permisos de escritura en mi cuenta de AWS?

No. El descubrimiento se realiza en modo solo lectura y no modifica ningún recurso de tu cuenta. La conexión puede hacerse de dos formas: un rol de solo lectura que se asume entre cuentas, protegido con ExternalId y sin almacenar credenciales tuyas, o desplegando el producto como appliance dentro de tu propia cuenta. Además, únicamente se analizan los procesos que selecciones de forma explícita, y tú decides qué cuentas, regiones y entornos entran en cada escaneo.

¿El producto lee el contenido de mis tablas?

No. El linaje se deduce del código, del SQL y de los metadatos de esquema —nombres de base, tabla y columna—, nunca de las filas. El contenido de los datos, las muestras y los valores de columna están clasificados como categoría que no puede salir hacia ningún modelo, ni externo ni local, y tampoco entran en el análisis. Las etiquetas de AWS también se excluyen, porque suelen contener correos, centros de coste o números de ticket que el linaje no necesita. El producto analiza cómo se mueven los datos, no los datos.

¿Cómo se controla quién puede ver o modificar el linaje?

Con usuarios propios del producto y tres roles acumulativos. Consulta permite recorrer el dashboard, el inventario, el catálogo, el linaje y el Copilot sin poder cambiar nada. Operación añade lanzar escaneos, extraer linaje y revisar relaciones. Administración añade gestionar conexiones AWS, proveedores de IA y usuarios. Además del rol, cada usuario tiene asignadas las conexiones AWS sobre las que puede trabajar, de modo que un equipo puede ver la cuenta de desarrollo y no la de producción. La autorización se comprueba en el servidor en cada petición: ocultar un botón es una comodidad, no la protección. Hoy el acceso no se integra con un directorio corporativo por SSO.

Contacto

Hablemos de tu plataforma de datos.

Cada arquitectura es diferente. Cuéntanos qué quieres entender, documentar, optimizar o gobernar y evaluaremos cómo adaptar la plataforma a tu entorno.

  • Revisión técnica de tu caso, sin compromiso
  • Demo sobre el producto real
  • Propuesta de piloto acotado

Añadir detalles Opcional: cargo, necesidad, mensaje y arquitectura.