01
Pilot
Analizamos un dominio o un conjunto limitado de pipelines para validar el valor con tu propio linaje.
Data Intelligence para AWS
TrustedLineage descubre tus recursos AWS en modo solo lectura y construye linaje explicable, con evidencia y confianza desde el proceso hasta la columna.
El problema
El lineage manual envejece en cuanto alguien despliega un job nuevo. Y cuando el conocimiento vive en unas pocas personas, cada cambio se convierte en una conversación en lugar de una consulta.
Respuesta
El grafo recorre el linaje hacia arriba hasta la fuente: qué proceso escribió la tabla, desde qué ruta S3 o tabla leyó, y con qué evidencia se dedujo cada salto.
Qué lo resuelve Explore · grafo de linaje
Respuesta
El análisis lee el código, el SQL, la configuración y los parámetros del proceso, y de ahí sale qué job o función escribe cada tabla.
Qué lo resuelve Analyze · análisis de código y SQL
Respuesta
El impacto se recorre hacia abajo desde la columna: qué procesos la leen, en qué tablas acaba y con qué transformación. A nivel de columna cuando hay evidencia que lo respalde.
Qué lo resuelve Explore · análisis de impacto
Respuesta
El mismo recorrido, en sentido contrario: los procesos que leen el dataset y los destinos a los que llega.
Qué lo resuelve Explore · linaje descendente
Respuesta
El inventario recoge los recursos descubiertos y sus ejecuciones detectadas, así que un proceso sin ejecuciones recientes se ve como lo que es.
Qué lo resuelve Discover · inventario y ejecuciones
Respuesta
Cada relación lleva su nivel de confianza y la evidencia con la que se dedujo. Tú confirmas, rechazas o dejas pendiente: el linaje publicado es el que has validado.
Qué lo resuelve Validate · confianza, evidencia y validación humana
Decenas de jobs, funciones y buckets sin una vista única que los relacione.
Tablas y datasets compartidos entre procesos que nadie ha inventariado.
Diagramas correctos el día que se dibujaron y obsoletos al despliegue siguiente.
Modificar un esquema exige preguntar por Slack en lugar de consultar el linaje.
Cómo funciona
Cinco etapas. Tú decides qué se analiza y qué se publica.
01 / 05
Conexión de solo lectura a tu entorno AWS para descubrir recursos y detectar procesos candidatos.
02 / 05
Eliges los procesos, cuentas y regiones que quieres analizar. Nada se analiza sin selección previa.
03 / 05
La IA analiza código, SQL, configuración, parámetros y dependencias del proceso seleccionado.
04 / 05
Revisas confianza y evidencia de cada relación: confirmar, rechazar o dejar pendiente.
05 / 05
Publicas el linaje y lo exploras con grafo, impacto, detalle de proceso y Copilot.
El producto
Un flujo continuo: escaneo, extracción, validación y exploración sobre la misma base de conocimiento. Estas son las pantallas del producto, no un concepto.
Tres recorridos para empezar. Las nueve áreas siguen disponibles.
Inventario del ecosistema AWS sin modificar tus recursos.
Cada relación llega con su nivel de confianza y su evidencia.
Navega el ecosistema y pregunta en lenguaje natural.
Linaje de datos
Vista general de relaciones entre procesos, tablas, rutas S3 y datasets escaneados
Procesos con linaje
12
Datasets
42
Tablas
35
Rutas S3
7
Relaciones canónicas
47
Columnas mapeadas
78
Revisadas
11%
Baja confianza
38
Relaciones destacadas · 47
| Origen | Relación | Destino | Cons. | Prod. | Confianza | Estado |
|---|---|---|---|---|---|---|
curated.crm_orders | Lee | glue-orders-curated |
1 | 0 | 96% | Confirmada |
glue-orders-curated | Escribe | ready.customer_360 |
0 | 1 | 92% | Confirmada |
accounts.name | Transforma | customer_360.client |
1 | 1 | 91% | Inferida |
crm_orders.amount | Transforma | customer_360.total |
1 | 1 | 84% | Pendiente |
s3://acme-raw/legacy/ | Lee | curated.accounts |
1 | 0 | 61% | Rechazada |
Exportable a CSV y recorrible con el teclado: es la alternativa accesible al grafo. Los cinco estados de revisión son Pendiente, Confirmada, Inferida, Rechazada y Todas. Nada se publica hasta que una persona lo revisa.
Dashboard
Resumen de cobertura, calidad y estado del linaje
Recursos descubiertos
259
▲ +125 vs. escaneo previo
Procesos detectados
61
▼ -21 vs. escaneo previo
Procesos con linaje
47
de 61 totales
Cobertura de linaje
77%
▲ +14 p.p. vs. previo
Confianza media
89%
confianza del proceso
Servicios detectados
6
▲ +3 vs. escaneo previo
Estado del linaje
Calidad del linaje
Cobertura por tipo de recurso (nº de relaciones)
Ver calidad de linaje →Tendencia de cobertura
Últimos 7 escaneosRequiere atención
4 alertasÚltimos escaneos
Procesos
61
Con linaje
47
Confianza
89 %
Cambios recientes
✦ Copilot (Linaje)
Ver historialHaz una pregunta sobre el linaje…
✦ ¿Qué procesos tienen baja confianza?
✦ ¿Qué procesos no tienen linaje extraído?
✦ ¿Qué cambió en el último escaneo?
✦ ¿Cuáles son los activos más críticos?
Recursos destacados
Ver todos →ready.customer_360Tablaglue-orders-curatedGlue Jobs3://acme-raw/orders/Ruta S3Mapa resumido de la plataforma
Ver mapa completoAWS Glue Jobs → Redshift: 156 relaciones · Amazon S3 → Redshift: 12 relaciones. Ruta directa sin pasar por Athena.
Cada alerta es un enlace: lleva a la lista de procesos o relaciones que la producen, no a un informe que haya que interpretar.
Copilot
Asistente inteligente para explorar linajes, procesos y dependencias
Conversaciones
Nuevaready.customer_360gold?¿Qué procesos escriben ready.customer_360?
✦ Claude · claude-sonnet-4-6
Dos procesos escriben esa tabla:
glue-orders-curated · Glue Jobfn-events-enrich · LambdaBasado en 32 relaciones publicadas del escaneo Discovery dev.
Haz una pregunta sobre el linaje…
Contexto de la conversación
Resumen
Escaneo Discovery dev con 259 recursos y 6 servicios. Contexto enviado al modelo: 30 recursos.
Metadatos clave
Acciones rápidas
El Copilot responde sobre el linaje ya publicado y cita de dónde sale cada afirmación. Con el proveedor local, ningún dato sale de la cuenta; con uno externo, sale solo lo que permite la política de Proveedores IA.
Descubrimiento de recursos AWS
Explora y descubre servicios y recursos en tu entorno AWS para generar linaje de datos
Contexto del escaneo
Qué obtendrás
Servicios incluidos
Seleccionar todosEsta cuenta está validada con avisos: no se analizará Glue Jobs ni Step Functions por permisos insuficientes. El escaneo puede ejecutarse igualmente.
Historial reciente · últimos 5
v3 Discovery dev Completadov2 Discovery dev Completadov1 Aceptación instalación limpia CompletadoEl escaneo no modifica nada: descubre recursos, detecta candidatos y compara con la ejecución anterior. Qué se analiza lo eliges tú en el paso 2, y nada se publica hasta el paso 4.
Inventario completo
Censo de la cuenta: todos los recursos, tengan linaje o no
Total de recursos
259
Tablas
33
12,7 % del total
Vistas
45
17,4 % del total
Jobs / Lambdas
39
15,1 % del total
Dashboards / Reportes
0
0,0 % del total
Otros recursos
142
54,8 % del total
Filtros rápidos
Tipo de recurso
Servicio / origen
Etiquetas (tags)
259 recursos encontrados
Orden: Última actualización| Nombre del recurso | Tipo | Servicio | Propietario | Dominio | Criticidad | Linaje |
|---|---|---|---|---|---|---|
ready.customer_360 | Tabla | AWS Glue | data-platform | dwh | Alta | Sí |
curated.crm_orders | Tabla | AWS Glue | data-platform | dwh | Media | Sí |
glue-orders-curated | Job / Lambda | AWS Glue | data-platform | dwh | Media | Sí |
acme-raw | Bucket S3 | S3 | data-platform | — | — | No |
fn-events-enrich | Lambda | AWS Lambda | — | — | — | No |
Mostrando 1–12 de 259 recursos · página 1 de 22. El inventario es el censo COMPLETO de la cuenta, con linaje o sin él; el catálogo, en la sección siguiente, es solo lo ya analizado.
Catálogo de recursos
Lo ya analizado, con su confianza y su estado de análisis
Recursos catalogados
259
Procesos
47
Tablas
33
Columnas
43
Servicios AWS
6
Escaneos disponibles
4
Filtros
Tipo de recurso
Entradas del catálogo
Orden: Confianza| Entrada | Tipo | Servicio | Análisis | Confianza |
|---|---|---|---|---|
glue-orders-curated | glue:job | glue | Analizado | 92% |
ready.customer_360 | glue:table | glue | Analizado | 96% |
fn-events-enrich | lambda:function | lambda | Analizado | 88% |
dwh.sales_fact | redshift:table | redshift | Pendiente | — |
El catálogo solo contiene lo ya analizado. Lo que está «Pendiente» aparece, pero sin confianza: no se ha extraído su linaje todavía.
Conexiones AWS
Cuentas que el producto puede explorar. Siempre en solo lectura
Acme Ingest DEV
VálidaModo: Appliance
Capacidades concedidas
Data Lake DEV
VálidaModo: Assume role
Capacidades concedidas
Las dos conexiones son de solo lectura. En modo Assume role el producto asume un rol de tu cuenta con un ExternalId que tú generas, y la pantalla declara si el cliente lo exige en su trust policy y cuándo se comprobó por última vez. Una conexión que deja de validar no se usa: se marca y se detiene.
Proveedores IA
Modelos que el producto puede usar para el Copilot y la extracción de linaje
Claude API externa
ValidadoLa credencial y el modelo se han confirmado contra el proveedor.
OpenAI API externa
ValidadoLa credencial y el modelo se han confirmado contra el proveedor.
Ollama Local
PredeterminadoSe ejecuta dentro del perímetro: ningún dato sale de la cuenta.
Qué datos pueden salir de la cuenta
v1 · cc7549dbe2c4Salida a proveedores externos habilitada. Los proveedores autorizados son claude y openai. Cada clase de dato sale con la transformación que indica su regla, y lo que aparece como «No sale» nunca cruza el perímetro.
| Clase de dato | Regla | Qué incluye |
|---|---|---|
| Identificadores de AWS | Sale pseudonimizado | ARN y Account ID, sustituidos por seudónimos estables. |
| Credenciales | No sale | Claves, contraseñas y tokens. Prohibido de forma inamovible: no configurable. |
| Valores de datos | No sale | Filas, muestras y contenido de columnas. |
| Etiquetas de recursos | No sale | Tags de AWS: suelen llevar correos, centros de coste o tickets. |
| Metadatos de recursos | Sale tal cual | Nombres, tipos y configuración de los recursos inventariados. |
| Metadatos de esquema | Sale tal cual | Nombres de base de datos, tabla y columna. Nunca su contenido. |
| Contenido sintético | Sale tal cual | Texto de prueba que genera el producto para validar un proveedor. |
| Código fuente | Secretos redactados | Código de los Glue Jobs, Lambdas y scripts que se analizan. |
| Sentencias SQL | Secretos redactados | Consultas y DDL encontradas en el código o en el catálogo. |
| Errores y diagnóstico | Secretos redactados | Mensajes de error y logs, recortados a su causa. |
| Pregunta del usuario | Secretos redactados | El texto que se escribe en el chat, y el hilo reciente. |
Esta política es configuración del despliegue: se define en config/ai-policy.yml, se revisa en el control de cambios y no se puede modificar desde la aplicación. La huella identifica el documento exacto con el que se está operando y se guarda en cada extracción.
Usuarios
Quién puede entrar, con qué rol y sobre qué conexiones AWS
Administración DEV
TúOperador de evidencia
Debe cambiar contraseñaTres roles, acumulativos
| Puede | Consulta | Operación | Administración |
|---|---|---|---|
| Consultar dashboard, inventario, catálogo, linaje y Copilot | ✔ | ✔ | ✔ |
| Lanzar escaneos y extraer linaje | ✔ | ✔ | |
| Revisar y publicar relaciones | ✔ | ✔ | |
| Validar una conexión AWS | ✔ | ✔ | |
| Gestionar conexiones, proveedores de IA y usuarios | ✔ |
El alcance se declara por conexión AWS: un usuario puede ver una cuenta y no otra. Ocultar un botón no es la protección: cada petición se autoriza en el servidor.
Vistas del producto sobre un entorno de demostración. La cuenta, los procesos y los nombres de tablas y datasets son ficticios.
Column-level lineage
Cuando el código y el SQL lo permiten, el análisis desciende a nivel de columna e identifica el tipo de transformación. Cuando la evidencia no es suficiente, la relación se marca como tal en lugar de darse por buena.
Cuatro relaciones detectadas entre las dos tablas. Elige una para ver de qué tipo es.
curated.crm_orders
ready.customer_360
direct order_id → order_id
La columna se copia sin transformar. Es la relación más fácil de sostener: el SELECT la nombra igual en origen y en destino.
rename customer_name → client
Mismo dato, otro nombre. El alias del SELECT es lo que permite seguir la pista; sin él, las dos columnas parecerían no tener relación.
cast order_ts → order_date
Cambia el tipo, no el contenido: de marca de tiempo a fecha. La conversión aparece en la expresión, y es lo que fija el tipo de transformación.
aggregation amount → total_amount
El valor de destino resume varias filas de origen. La relación existe, pero ya no es uno a uno, y eso cambia cómo hay que leer el impacto.
Casos de uso
Qué te deja responder
¿Qué se rompe si toco esta tabla o esta columna?
Conoce qué puede romperse antes de modificar una tabla, una columna o un job.
Qué te deja responder
¿De dónde sale este dato y quién responde de él?
Comprende origen, destino y transformación de la información que gobiernas.
Qué te deja responder
¿Qué hay montado en esta cuenta y cómo se relaciona?
Documenta una plataforma AWS existente sin partir de diagramas manuales.
Qué te deja responder
¿Qué proceso dejó mal este dato y cuándo?
Sigue dependencias y productores de datos para llegar al origen del problema.
Qué te deja responder
¿Qué depende de lo que quiero migrar o retirar?
Entiende los sistemas actuales antes de migrarlos, consolidarlos o refactorizarlos.
Qué te deja responder
¿Con qué evidencia sostengo que el dato circuló así?
Aporta trazabilidad y evidencia sobre cómo circula la información entre sistemas.
¿Reconoces alguno de estos escenarios en tu plataforma?
Solicitar demoSeguridad e IA
La conexión a tu cuenta AWS es de solo lectura: descubre recursos y procesos sin modificar nada, y solo se analiza lo que tú seleccionas.
Filas, muestras y contenido de columnas no entran en el análisis ni salen de tu cuenta. Se analiza cómo se mueve el dato, no el dato.
Ollama en local, sin que nada salga de tu red, o Claude u OpenAI bajo una política de salida declarada clase de dato por clase de dato.
Preferimos ser explícitos: hoy no reclamamos certificaciones ni sellos de cumplimiento, y el acceso es con usuarios propios del producto, no con vuestro SSO corporativo todavía. Los requisitos concretos de seguridad, despliegue y tratamiento de datos se revisan caso por caso durante la evaluación.
Sólo se analizan los procesos que tú seleccionas explícitamente.
Tú decides cuentas, regiones, entornos y procesos incluidos en cada escaneo.
Creas un rol de solo lectura en tu cuenta con la trust policy que te proporciona el producto, protegido con ExternalId. No se almacenan credenciales de tu cuenta: se asume el rol para cada operación.
El producto se despliega en tu propio entorno AWS y trabaja desde dentro. Para organizaciones que no permiten ningún acceso desde fuera de su perímetro.
En ambos casos
Cada conexión se valida y muestra qué puede hacer y qué no: descubrimiento, Glue Jobs, catálogo, Lambda, Step Functions o lectura de código en S3. Si falta un permiso, se ve antes de escanear en lugar de fallar a mitad.
Identidad y sesión
Contraseñas almacenadas con Argon2id. La sesión vive en el servidor y el navegador solo recibe una cookie HttpOnly, Secure y SameSite; el token se guarda hasheado, así que una copia de la tabla no entrega sesiones reutilizables. Caduca por inactividad y tiene además un techo absoluto, y los intentos fallidos repetidos bloquean la cuenta de forma temporal.
Autorización
Consulta recorre el producto entero sin poder cambiar nada. Operación añade lanzar escaneos, extraer linaje y revisar relaciones. Administración añade gestionar conexiones, proveedores de IA y usuarios. Son acumulativos, se comprueban en el servidor en cada petición y un rol que el código no reconozca se queda sin permisos, no con todos.
Alcance
El permiso no es lo único que se comprueba: cada usuario tiene asignadas las conexiones sobre las que puede trabajar. Un equipo puede ver su cuenta de desarrollo y no la de producción. La instalación es dedicada por cliente y da servicio a varias cuentas AWS.
Los metadatos no siempre contienen la relación: muchas veces está escrita en el código, en el SQL o en la configuración del job. La IA lee esos artefactos e infiere la relación, y deja por escrito en qué se basa.
Cada relación propuesta lleva confianza y evidencia, y pasa por revisión antes de publicarse. Sin caja negra.
Tu código no tiene por qué salir
Analizar el linaje exige leer el código y el SQL de tus procesos. Por eso puedes elegir dónde se ejecuta el modelo: Ollama en local, sin que nada salga de tu red, o las APIs de Anthropic u OpenAI si prefieres su capacidad.
Se elige por extracción, junto con el objetivo de confianza y si el análisis debe incluir SQL, configuración, variables de entorno y dependencias.
Y si eliges una API externa
No hay un único interruptor de «permitir llamadas externas». Cada clase de dato tiene su regla, y el producto la aplica antes de hablar con el proveedor:
El producto analiza cómo se mueven los datos, no los datos: el contenido de las tablas nunca entra en el análisis. La política es configuración versionada, la interfaz la muestra sin poder editarla, y si falta o tiene una errata se bloquea toda salida externa en lugar de asumir lo más permisivo.
Modelo de adopción
El producto está en fase de validación con las primeras organizaciones. Eso significa acceso directo a quien lo construye y prioridades que entran en el roadmap de verdad.
01
Analizamos un dominio o un conjunto limitado de pipelines para validar el valor con tu propio linaje.
02
Extensión progresiva a más cuentas, regiones, entornos y procesos.
03
Ajuste de reglas de análisis, integraciones y capacidades a necesidades particulares.
El linaje se persiste en PostgreSQL como fuente de verdad y, opcionalmente, se sincroniza el grafo en Neo4j. Se puede adoptar como producto, como acelerador de un proyecto de gobierno o como plataforma configurada para un entorno concreto.
Cuéntanos tu arquitectura y evaluamos el encaje.
Evaluar un pilotoRoadmap
El mismo conocimiento técnico que permite construir el linaje habilita otros servicios sobre la plataforma. Separamos con claridad lo que existe hoy de lo que está en roadmap.
Fuera de esto: el acceso es con usuarios del propio producto. La integración con un directorio corporativo —SSO, SAML u OIDC— está prevista y la autorización ya está construida para no depender de cómo te autentiques, pero hoy no está.
Analizar jobs, funciones y SQL para señalar complejidad, redundancias, código duplicado y transformaciones costosas.
Hoy se genera documentación por recurso en Markdown, con su nivel de confianza. Lo que falta es elevarla a documentación de arquitectura con diagramas y mantenerla sincronizada con cada escaneo.
Detectar pipelines sin consumidores, procesos duplicados, activos obsoletos y dependencias críticas.
Comparar escaneos para identificar nuevos procesos, recursos eliminados, cambios de esquema y su impacto potencial.
Enlazar un problema de calidad con el dataset, el proceso productor y la fuente para acelerar el root-cause analysis.
Cruzar arquitectura y ejecución para localizar procesos sobredimensionados, jobs redundantes y recursos infrautilizados.
Evaluar plataformas existentes con IA y linaje antes de migrar, refactorizar, consolidar o retirar procesos.
Proponer tests SQL, validaciones de contrato, tests de regresión y data quality checks a partir del linaje.
Evolucionar el linaje hacia un grafo de conocimiento que conecte datos, documentación, owners, calidad, coste, políticas e incidencias.
Las capacidades marcadas como roadmap no están disponibles todavía y su alcance puede cambiar. Si alguna es prioritaria para tu equipo, cuéntanoslo.
Preguntas frecuentes
El linaje de datos, o data lineage, es el registro de cómo se mueve y se transforma la información entre sistemas: de qué fuente viene un dato, qué proceso lo lee, qué transformaciones sufre y en qué tabla o dataset acaba. Permite responder preguntas de impacto y de gobierno del dato sin depender del conocimiento de una persona concreta.
De forma manual se hace con diagramas y hojas de cálculo que envejecen en cuanto alguien despliega un job nuevo. AI Data Lineage Mapper lo obtiene del propio entorno: descubre los recursos de la cuenta en modo solo lectura y analiza el código, el SQL y la configuración de los procesos que selecciones. Los procesos que se analizan para extraer linaje son Glue Jobs, funciones Lambda y Step Functions, y las relaciones resultantes conectan tablas del Glue Data Catalog, rutas de Amazon S3 y objetos de Redshift.
Es el linaje que baja del nivel de tabla al de campo: qué columna de origen alimenta cada columna de destino y con qué transformación (direct, rename, cast, calculation, join o aggregation). Se identifica cuando el código y el SQL contienen evidencia suficiente; cuando no la hay, la relación se marca como tal en lugar de darse por buena.
Con el linaje publicado se consulta en el grafo o se pregunta al Copilot en lenguaje natural. Para cualquier tabla, dataset o ruta S3 puedes ver sus procesos productores y consumidores, y recorrer el linaje aguas arriba y aguas abajo tantos niveles como necesites.
El análisis de impacto recorre el linaje hacia abajo desde el activo que quieres cambiar y lista los procesos, tablas y datasets que dependen de él. Así sabes qué puede romperse antes de tocar un esquema, en lugar de preguntarlo por chat y esperar a que alguien recuerde la respuesta.
Cada relación se propone con un nivel de confianza y la evidencia concreta en la que se basa: fichero y línea del código, sentencia SQL o parámetro del job. Después pasa por revisión humana antes de publicarse, y puede confirmarse, rechazarse o quedar pendiente. La IA propone y una persona decide, así que no hay caja negra.
Solo si tú lo eliges. El proveedor del modelo se configura en cada extracción: puedes usar Ollama ejecutándose en tu propia infraestructura, y entonces ni el código ni el SQL salen de tu red, o las APIs de Anthropic u OpenAI si prefieres su capacidad. La decisión es explícita y se toma antes de lanzar el análisis.
No. El descubrimiento se realiza en modo solo lectura y no modifica ningún recurso de tu cuenta. La conexión puede hacerse de dos formas: un rol de solo lectura que se asume entre cuentas, protegido con ExternalId y sin almacenar credenciales tuyas, o desplegando el producto como appliance dentro de tu propia cuenta. Además, únicamente se analizan los procesos que selecciones de forma explícita, y tú decides qué cuentas, regiones y entornos entran en cada escaneo.
No. El linaje se deduce del código, del SQL y de los metadatos de esquema —nombres de base, tabla y columna—, nunca de las filas. El contenido de los datos, las muestras y los valores de columna están clasificados como categoría que no puede salir hacia ningún modelo, ni externo ni local, y tampoco entran en el análisis. Las etiquetas de AWS también se excluyen, porque suelen contener correos, centros de coste o números de ticket que el linaje no necesita. El producto analiza cómo se mueven los datos, no los datos.
Con usuarios propios del producto y tres roles acumulativos. Consulta permite recorrer el dashboard, el inventario, el catálogo, el linaje y el Copilot sin poder cambiar nada. Operación añade lanzar escaneos, extraer linaje y revisar relaciones. Administración añade gestionar conexiones AWS, proveedores de IA y usuarios. Además del rol, cada usuario tiene asignadas las conexiones AWS sobre las que puede trabajar, de modo que un equipo puede ver la cuenta de desarrollo y no la de producción. La autorización se comprueba en el servidor en cada petición: ocultar un botón es una comodidad, no la protección. Hoy el acceso no se integra con un directorio corporativo por SSO.
Contacto
Cada arquitectura es diferente. Cuéntanos qué quieres entender, documentar, optimizar o gobernar y evaluaremos cómo adaptar la plataforma a tu entorno.