使用 Orchestration Pipelines 运行数据和 AI 流水线,并为其预配资源

Managed Airflow(第 3 代) | Managed Airflow(第 2 代) | Managed Airflow(旧版第 1 代)

本页面介绍了 Orchestration Pipelines 与 Managed Airflow 之间的关系。

Orchestration Pipelines 简介

Orchestration Pipelines 是一个统一的声明式编排和自动化部署框架,经过优化,可在 上无缝管理数据和 AI 流水线 Google Cloud。

借助 Orchestration Pipelines,您可以使用基于 YAML 的声明式领域专用语言 (DSL) 定义流水线及其部署配置。此框架会抽象出底层基础架构,让您可以专注于数据和 AI 工作流的逻辑,而 Orchestration Pipelines 则负责处理部署、版本控制和编排。

Orchestration Pipelines 中的 Managed Airflow 环境简介

Managed Airflow 是在流水线部署后运行流水线的编排引擎。您可以将 Managed Airflow 环境作为流水线定义的一部分进行分配。在 Orchestration Pipelines 中,此环境称为“运行器环境”

编排流水线的优势:

  1. 您可以让组织中不是 Airflow 专家的团队创建和运行其工作流,而无需编写 DAG 或配置 Airflow。 例如,您可以在临时 Managed Service for Apache Spark 集群中运行笔记本,并在 YAML 中指定其执行的所有时间表、资源和配置参数,而无需编写任何 DAG 代码。

  2. Orchestration Pipelines 中的所有配置和部署都基于 YAML 和 gcloud CLI 命令。所有 Airflow DAG 都是自动生成的,无需与 Airflow、Managed Airflow 环境或环境存储分区进行交互。您可以在常规 Git 代码库(资源文件所在的位置)中开发和部署工作流。

  3. 您的 YAML 定义适用于所有版本的 Airflow。您无需针对 Airflow 版本之间的更改或已安装软件包的差异调整代码。例如,如果您从 Airflow 2 迁移到 Airflow 3,则无需迁移流水线。

  4. Orchestration Pipelines 与 Google Cloud Data Agent Kit 扩展程序集成,因此您可以 使用智能体编写和问题排查。您可以使用代理 编写流水线、简化 部署,并通过同一扩展程序观察流水线状态。

Orchestration Pipelines 的工作原理

Orchestration Pipelines 支持各种操作和 Google Cloud 服务,例如:

  • 在 Managed Service for Apache Spark 中运行 PySpark 脚本。
  • 在 Managed Service for Apache Spark 中运行笔记本文件。
  • 在 BigQuery 或 Managed Service for Apache Spark 中执行 SQL 查询。
  • 在 Dataform 或 dbt 框架中执行数据处理流水线。
  • 运行 Python 脚本。

Orchestration Pipelines 的典型工作流如下:

  1. 您将流水线定义为必须使用其中一项 服务 执行的一系列操作 Google Cloud 。
  2. 您为流水线操作定义资源配置。例如,您可以指定必须在具有特定配置的临时 Managed Service for Apache Spark 集群上执行特定操作。
  3. (可选)您可以通过 预配的资源 机制定义必须自动 预配的 资源(如果这些资源尚不存在)。例如,您可以指定必须创建具有特定配置的静态 Managed Service for Apache Spark 集群。
  4. 您将流水线定义文件(包含要执行的操作)添加到 Git 代码库。
  5. 您将各个流水线操作的资产(例如脚本或笔记本文件)添加到 Git 代码库。
  6. 您可以使用 gcloud CLI 命令将流水线部署到 Managed Airflow 环境。Orchestration Pipelines 会自动创建一些运行流水线的 DAG 文件。

    与独立的 Airflow DAG 相比,这些 DAG 是自动生成的,您无需以任何方式对其进行管理。您可以使用 gcloud CLI 命令检查流水线执行状态和管理流水线。

  7. 您的环境会按计划执行流水线。

后续步骤