External Lineage en Snowflake: saber de dónde viene cada dato, también fuera de la plataforma

Snowflake ya permitía trazar el recorrido de un dato dentro de sus propios objetos. Desde el 3 de septiembre de 2026, External Lineage amplía esa capacidad a sistemas externos y ya está disponible con carácter general para entornos productivos.

Hay una pregunta que todo equipo de datos ha tenido que responder alguna vez con más dudas de las que le gustaría:

¿De dónde sale exactamente este número?

La pregunta puede aparecer durante una auditoría, una revisión de cumplimiento normativo o simplemente cuando dos informes no cuadran. Y responderla suele implicar reunir a varias personas, revisar procesos, consultar integraciones y reconstruir el recorrido del dato manualmente.

Hasta ahora, Snowflake ofrecía linaje nativo entre objetos y columnas dentro de la plataforma: un mapa de cómo se relacionan tablas, vistas y otros elementos.

El problema es que la mayoría de las arquitecturas de datos actuales no viven únicamente dentro de Snowflake. Los datos pueden partir de sistemas operacionales, pasar por herramientas de orquestación y transformación y terminar en diferentes destinos.

Ahí es donde entra External Lineage.

Según la documentación oficial de Snowflake sobre External Lineage, esta funcionalidad extiende el linaje nativo para incorporar fuentes y destinos externos a Snowflake, proporcionando una visión más completa de cómo se mueven los datos a través del ecosistema.

¿Qué es Snowflake External Lineage?

External Lineage permite ampliar el mapa de linaje de Snowflake más allá de sus propios objetos.

La funcionalidad utiliza OpenLineage, un estándar abierto para capturar y compartir información sobre el linaje de datos. Herramientas como dbt y Apache Airflow pueden enviar eventos de OpenLineage a un endpoint REST de Snowflake, que incorpora esa información al grafo de linaje que ya se visualiza en Snowsight.

Puedes consultar los detalles técnicos en la documentación de Snowflake sobre External Lineage y en la documentación de OpenLineage para dbt.

Snowflake anunció esta funcionalidad como Preview el 16 de enero de 2026 y la declaró General Availability el 3 de septiembre de 2026. Por tanto, ya no hablamos de una capacidad experimental, sino de una funcionalidad disponible para escenarios productivos.

Y hay tres capacidades especialmente relevantes:

  • Linaje entre sistemas externos: puede representar relaciones entre un objeto de Snowflake y un objeto externo, pero también entre dos objetos externos, aunque Snowflake no intervenga directamente en ese tramo.
  • Linaje a nivel de columna: permite representar relaciones entre columnas mediante la información de columnLineage.
  • Consulta mediante SQL: el linaje externo puede consultarse programáticamente, además de visualizarse en Snowsight mediante el grafo de linaje.

Esto último es especialmente interesante para los equipos de datos: la trazabilidad no tiene por qué limitarse a una consulta manual en una interfaz. Puede integrarse en procesos automatizados y flujos de gobierno.

Snowflake documenta estas capacidades en sus notas de lanzamiento de External Lineage.

¿Qué permite hacer que antes era más difícil?

Análisis de dependencias

Antes de modificar una tabla o proceso, es posible analizar qué objetos y destinos dependen de él, incluyendo elementos que se encuentran fuera de Snowflake.

Esto permite anticipar mejor el impacto de un cambio y reducir el riesgo de romper procesos aguas abajo.

Auditoría y cumplimiento

El linaje ayuda a documentar la procedencia de un dato a través de diferentes sistemas, facilitando la investigación cuando es necesario demostrar de dónde procede determinada información.

En lugar de reconstruir el recorrido manualmente, los equipos pueden apoyarse en el grafo de linaje disponible en Snowflake.

Migraciones y modernización de arquitecturas

Durante una migración desde sistemas legacy hacia la nube, conocer las dependencias entre sistemas resulta especialmente relevante.

External Lineage permite visualizar cómo se conectan diferentes tramos del pipeline, incluso cuando algunos de ellos se encuentran fuera de Snowflake.

Diagnóstico de problemas

Cuando un dato llega incorrecto a un informe o proceso, el linaje permite reducir rápidamente el número de sistemas y transformaciones que hay que investigar.

El objetivo no es determinar automáticamente dónde se produjo el error, sino acotar el recorrido que debe revisarse.

Linaje de datos: qué hace y qué no hace

Conviene ser precisos.

El data lineage muestra cómo se relacionan los datos y por qué sistemas han pasado. Permite conocer dependencias upstream y downstream y seguir el recorrido de los objetos dentro del pipeline.

Pero el linaje, por sí solo, no determina la calidad del dato ni explica el significado de negocio de una métrica.

Por ejemplo, saber que un indicador procede de una determinada tabla no responde necesariamente a preguntas como:

  • ¿Qué significa exactamente este KPI?
  • ¿Quién es responsable de este dato?
  • ¿Qué reglas de calidad debe cumplir?
  • ¿Qué política debe aplicarse a esta información?

Estas cuestiones pertenecen a otras dimensiones del data governance, como la calidad, el contexto semántico, la clasificación o la asignación de responsables.

¿Por qué External Lineage importa más allá del equipo técnico?

La trazabilidad suele presentarse como una cuestión de ingeniería de datos, pero su impacto va mucho más allá.

El primer beneficio es la confianza en el dato.

Cuando la procedencia de una cifra está documentada y puede consultarse, la organización deja de depender de que una persona recuerde cómo se construyó determinado informe. Esto ayuda a reducir fricciones entre equipos y facilita que los usuarios confíen en los datos que utilizan para tomar decisiones.

El segundo beneficio es el coste de responder a preguntas sobre los datos.

Una auditoría, una revisión interna o una consulta sobre el origen de un indicador pueden pasar de requerir una reconstrucción manual a apoyarse en la información de linaje disponible en la plataforma.

El ahorro concreto dependerá de cada organización, pero el cambio es significativo: pasar de reconstruir el recorrido del dato a poder consultarlo.

¿Cómo funciona External Lineage con OpenLineage?

Snowflake utiliza OpenLineage como estándar para recibir información de linaje procedente de herramientas externas.

El funcionamiento general es sencillo:

  1. Una herramienta como dbt o Apache Airflow genera eventos de OpenLineage.
  2. Estos eventos se envían al endpoint REST de External Lineage de Snowflake.
  3. Snowflake incorpora la información al grafo de linaje.
  4. Los objetos externos aparecen en Snowsight como nodos externos.
  5. El linaje puede consultarse también mediante SQL.

Snowflake proporciona instrucciones específicas para configurar dbt con External Lineage y para integrar Apache Airflow con OpenLineage.

La ventaja de utilizar OpenLineage es que no es necesario construir desde cero un modelo propietario de intercambio de metadatos para cada herramienta que ya dispone de integración.

¿Se puede consultar el linaje con SQL?

Sí. Y es una de las capacidades más interesantes para automatizar procesos de gobierno.

Snowflake permite consultar información de linaje mediante la función SNOWFLAKE.CORE.GET_LINEAGE. La función permite consultar relaciones upstream y downstream y trabajar también con objetos externos una vez que su información de linaje ha sido incorporada a la cuenta.

Puedes consultar los detalles y la sintaxis en la documentación oficial de GET_LINEAGE de Snowflake.

Esto abre la puerta a utilizar el linaje como información operativa, no solo como una representación visual para investigar incidencias.

¿Qué hace falta para ponerlo en marcha?

External Lineage requiere una cuenta Snowflake Enterprise Edition o superior. Además, el usuario que envía la información debe contar con los privilegios necesarios para ingerir el linaje y acceder a los objetos de Snowflake referenciados.

La configuración implica, entre otros aspectos:

  • Configurar la herramienta de datos para generar eventos OpenLineage.
  • Definir el endpoint de External Lineage de Snowflake.
  • Configurar el método de autenticación.
  • Asignar los permisos necesarios.
  • Decidir qué flujos y sistemas se incorporarán al modelo de linaje.

Por tanto, no se trata simplemente de activar una casilla. La integración técnica es relativamente directa cuando las herramientas ya cuentan con soporte OpenLineage, pero el diseño de qué información se quiere trazar y cómo encaja dentro de la estrategia global de gobierno del dato requiere planificación.

Los requisitos y pasos de configuración de External Lineage están detallados por Snowflake.

Empezar por lo que importa

External Lineage tiene límites de capacidad y un periodo de retención de un año, por lo que decidir qué flujos se incorporan al sistema de linaje es una cuestión de diseño, no un detalle menor. La documentación actual de Snowflake establece, entre otras limitaciones, un máximo de 20.000 aristas de linaje externo almacenadas por cuenta y hasta 15.000 aristas generadas por un único evento.

Por eso, el enfoque más eficaz no suele ser intentar trazarlo todo desde el primer día.

Es mejor identificar primero los flujos que alimentan decisiones críticas para el negocio:

  • Los datos que aparecen en el comité de dirección.
  • Los indicadores utilizados en informes regulatorios.
  • La información que alimenta procesos de facturación.
  • Los datos utilizados en procesos financieros o de negocio críticos.
  • Los pipelines de los que dependen múltiples informes o aplicaciones.

Son precisamente los flujos sobre los que alguien terminará preguntando:

¿De dónde sale este dato?

A partir de ese núcleo, ampliar el mapa tiene sentido. Intentar documentarlo todo desde el principio puede terminar generando un grafo enorme que nadie consulta.

External Lineage como pieza de una estrategia de Data Governance

External Lineage resuelve una parte concreta del gobierno del dato: la trazabilidad.

Pero una estrategia completa de Data Governance necesita combinar esa trazabilidad con otras capacidades, como calidad de datos, clasificación, políticas de acceso, contexto semántico y asignación de responsabilidades.

Snowflake integra estas capacidades dentro de Horizon Catalog, que combina catálogo, gobierno, calidad, protección y linaje de datos. Puedes consultar más información en la documentación de Snowflake Horizon Catalog.

La clave está, por tanto, en no entender External Lineage como una solución aislada, sino como una pieza más dentro de una arquitectura de gobierno del dato.

¿Sabrías responder hoy de dónde viene cada dato de tu cuadro de mando?

La trazabilidad ya no tiene por qué terminar en la frontera de Snowflake.

Con External Lineage, Snowflake amplía el mapa para conectar los diferentes sistemas que participan en el recorrido del dato y ofrece una visión más completa de cómo la información llega hasta los procesos y decisiones que dependen de ella.

En Bravent ayudamos a equipos de datos a implantar estrategias de Data Governance, trazabilidad y gestión del dato sobre sus plataformas analíticas, poniendo el foco en los flujos que realmente sostienen el negocio.

¿Hablamos? info@bravent.net

arturo

Arturo González Martínez

Senior Technical Lead Big Data & Power BI - Bravent
    Resumen de privacidad

    Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

    Cookies estrictamente necesarias

    Las cookies estrictamente necesarias tiene que activarse siempre para que podamos guardar tus preferencias de ajustes de cookies.

    Cookies de terceros

    Esta web utiliza cookies analíticas para recopilar información anónima tal como el número de visitantes del sitio, o las páginas más populares.

    Dejar esta cookie activa nos permite mejorar nuestra web.