Azure Databricks サーバーレスワークスペースによるデータ分析基盤の構築とセキュリティ設計

Tech

本記事はGeminiの出力をプロンプト工学で整理した業務ドラ portable(未検証)です。

Azure Databricks サーバーレスワークスペースによるデータ分析基盤の構築とセキュリティ設計

【導入】

従来必須だったVNetインジェクションやクラスタ起動時間のオーバーヘッドを解消し、データ分析基盤の運用負荷とコストを大幅に削減します。

【アーキテクチャ設計】

Azure Databricks サーバーレス Compute(Serverless Real-Time Compute)では、コンピュートリソースが Databricks が管理するシステム側の Azure サブスクリプション上で完全に分離された環境として実行されます。顧客側の Azure サブスクリプション(コントロールプレーン側)からはクラスタ管理の負担が完全に取り除かれます。

データリソース(Azure Data Lake Storage Gen2 など)へのプライベート接続は、Databricks コントロールプレーン側で定義する Network Connectivity Configurations (NCC) を介して、Private Endpoint 経由で安全に接続されます。

graph TD
    User["ユーザー / データサイエンティスト"] -->|認証: Azure Entra ID| CP["Databricks コントロールプレーン"]

    subgraph Customer_Subscription["顧客 Azure サブスクリプション"]
        CP
        ADLS["Azure Data Lake Storage Gen2"]
        KV["Azure Key Vault"]
    end

    subgraph Databricks_Managed_Serverless["Databricks 管理 サーバーレス VNet"]
        ServerlessCompute["サーバーレス コンピュート
Serverless SQL / Notebooks"] end CP -->|ジョブ指示 / 認証| ServerlessCompute ServerlessCompute -->|Private Endpoint / NCC| ADLS ServerlessCompute -->|Secret Scope| KV

解説:

  1. ユーザー層: Azure Entra ID(旧 Active Directory)を用いた SSO および Conditional Access(条件付きアクセス)により安全に認証します。

  2. コントロールプレーン: 顧客サブスクリプション内にワークスペースメタデータやノートブック定義を維持します。

  3. サーバーレスコンピュート層: Databricks 管理の独立した安全なマルチテナント/シングルテナント隔離境界内で、秒単位でコンピュートが起動・スケールします。

  4. データアクセス層: NCC を構成することで、サーバーレス VNet から顧客の ADLS Gen2 や Key Vault へ Private Link を経由した閉域接続を実現します。


【実装・デプロイ手順】

サーバーレスコンピュートを有効化した Azure Databricks ワークスペースおよび Unity Catalog との連携を Terraform (HashiCorp) で定義します。

# Azure Databricks ワークスペースの定義

resource "azurerm_databricks_workspace" "example" {
  name                = "dbw-serverless-prod-001"
  resource_group_name = azurerm_resource_group.rg.name
  location            = azurerm_resource_group.rg.location
  sku                 = "premium" # サーバーレス機能の利用には Premium SKU が必須

  tags = {
    Environment = "Production"
    ManagedBy   = "Terraform"
  }
}

# Databricks Provider 設定

provider "databricks" {
  host = azurerm_databricks_workspace.example.workspace_url
}

# サーバーレス ネットワーク構成 (NCC) の作成

resource "databricks_mws_network_connectivity_config" "ncc" {
  name           = "ncc-databricks-prod"
  region         = azurerm_resource_group.rg.location
}

# ADLS Gen2 への Private Endpoint ルールの作成

resource "databricks_mws_private_access_settings" "pas" {
  private_access_settings_name = "pas-prod"
  region                       = azurerm_resource_group.rg.location
  public_access_enabled        = true
}

デプロイメントの実行(Azure CLI / Terraform):

# Azure へのログインとサブスクリプションのセット

az login
az account set --subscription "YOUR_SUBSCRIPTION_ID"

# Terraform の初期化と適用

terraform init
terraform plan -out=tfplan
terraform apply tfplan

【アイデンティティとセキュリティ】

Azure Databricks サーバーレス環境におけるセキュリティ設計は、Well-Architected Framework のセキュリティの柱に基づき、以下の階層型防御(Defense-in-Depth)を適用します。

  1. アイデンティティとアクセス管理(IAM):

    • Azure Entra ID 連携: シングルサインオン(SSO)および SCIM によるユーザー/グループの自動同期を構成します。

    • Unity Catalog による統合ガバナンス: テーブル、ビュー、ファイル、モデルレベルでの細かいアクセス制御(RBAC)を適用し、サーバーレスコンピュート上でも統一された権限モデルを保持します。

  2. ネットワークセキュリティ:

    • Network Connectivity Configurations (NCC): Databricks 管理のサーバーレス VNet から顧客のストレージアカウントに対して Private Endpoint を動的に構成し、パブリックインターネットを経由しないデータアクセスを保証します。

    • IP アクセスリスト: ワークスペースへのアクセスを特定のオフィス IP や VPN 出口 IP に制限します。

  3. データ保護と暗号化:

    • 顧客管理キー(CMK: Customer-Managed Keys)を使用した DBFS およびサーバーレス一時ディスクの暗号化をサポート(要要件確認)。

【運用・コスト最適化】

サーバーレスワークスペースの導入により、可観測性の向上と TCO(総所有コスト)削減を同時に達成します。

  1. DBU(Databricks Unit)の効率化と即時自動スケーリング:

    • 従来の仮想マシンベースでは「起動・停止に伴う数分間の待機時間(ウォームアップ)」が発生していましたが、サーバーレスでは数秒でコンピュートが起動するため、アイドル時間の無駄な DBU 消費を最小化できます。

    • Auto-stop 機能: クエリ非アクティブ時に即座にコンピュートが解放されます。

  2. 可観測性(Observability)の統合:

    • Azure Log Analytics / Azure Monitor と統合し、DatabricksJobsDatabricksNotebookDatabricksSQL の監査ログ(Audit Logs)を集中収集します。
# Azure Monitor Diagnostic Settings の構成 (PowerShell)

Set-AzDiagnosticSetting -ResourceId "/subscriptions/YOUR_SUB_ID/resourceGroups/rg-prod/providers/Microsoft.Databricks/workspaces/dbw-serverless-prod-001" `
  -WorkspaceId "/subscriptions/YOUR_SUB_ID/resourceGroups/rg-prod/providers/Microsoft.OperationalInsights/workspaces/log-analytics-prod" `
  -Enabled $true

【まとめ】

導入時に考慮すべき重要事項および注意点は以下の3点です。

  1. SKU 前提条件: サーバーレス機能(SQL Serverless, Serverless Notebooks/Jobs)を利用するためには、Databricks ワークスペースが Premium SKU であることが必須です。

  2. ネットワーク設計の変更(落とし穴): 従来の VNet Injection(VNet 挿入)とは異なり、サーバーレスのデータアクセスは NCC(Network Connectivity Configurations) と Private Link を利用して構成するため、従来の Azure VNet ピアリング前提の設計を変更する必要があります。

  3. Unity Catalog の必須化: サーバーレスコンピュートにおけるデータガバナンスと安全なデータアクセスを担保するため、Unity Catalog の導入を早期に計画・適用することが推奨されます。

ライセンス:本記事のテキスト/コードは特記なき限り CC BY 4.0 です。引用の際は出典URL(本ページ)を明記してください。
利用ポリシー もご参照ください。

コメント

タイトルとURLをコピーしました