- 参考
- メモ
- 公式ドキュメントのうち気になったところのメモ(2019/5時点のメモ)
- Databrciksドキュメントの気になったところのメモ(2019/5時点のメモ)
- クイックスタートから実装を追ってみる(2019/5時点でのメモ)
- Data Source V1とV2
- 設定の類
- チェックポイントを調査してみる
- 動作確認しながら実装確認(v0.5.0)
- スキーマバリデーション
- パーティション
- Delta Table
- タイムトラベル
- org.apache.spark.sql.delta.OptimisticTransactionImpl#commit
- プロトコルバージョン
- アイソレーションレベル
- コンパクション
- バキューム
- コンフィグ
- ログのクリーンアップ
- ParquetからDeltaテーブルへの変換
- Symlink Format Manifest
- 類似技術
参考
- 公式ドキュメント
- 公式ドキュメント(クイックスタート)
- ストリームへの対応についての説明
- 公式クイックスタート
- DatabricksのDelta Lakeの説明
- DataFrameを使った上書き
- データ・リテンション
- VACUUM
- 最適化
- Delta LakeのOptimistic Concurrency Controlに関する記述
- Apache Hudi
- 公式ドキュメントのCompact filesの説明
- 公式ドキュメントのパーティション説明
- 公式ドキュメントのスキーマバリデーション
- 公式ドキュメントのスキーママージ
- 公式ドキュメントのスキーマ上書き
- 公式ドキュメントのマージの例
- 公式ドキュメントのマージを使った上書き
- Slowly changing data (SCD) Type 2 operation
- Write change data into a Delta table
- Upsert from streaming queries using foreachBatch
- org.apache.spark.sql.streaming.DataStreamWriter#foreachBatch
- 公式ドキュメントのVacuum
- Presto and Athena to Delta Lake Integration
- Presto Athena連係の制約
メモ
公式ドキュメントのうち気になったところのメモ(2019/5時点のメモ)
以下、ポイントの記載。あくまでドキュメント上の話。
Sparkのユーザから見たときにはデータソースとして使えばよいようになっている
SparkにはData Sourceの仕組みがあるが、その1種として使えるようになっている。 したがって、DatasetやDataFrameで定義したデータを読み書きするデータソースの1種類として考えて使えば自然に使えるようになっている。
スキーマの管理
通常のSpark APIでは、DataFrameを出力するときに過去のデータのスキーマを考慮したりしないが、 Delta Lakeを用いると過去のスキーマを考慮した振る舞いをさせることができる。 例えば、「スキーマを更新させない(意図しない更新が発生しているときにはエラーを吐かせるなど)」、 「既存のスキーマを利用して部分的な更新」などが可能。
またカラムの追加など、言ってみたら、スキーマの自動更新みたいなことも可能。
ストリームとバッチの両対応
ストリームへの対応についての説明 に記載があるが、Spark Structured Streamingの読み書き宛先として利用可能。 ストリーム処理では「Exactly Once」セマンティクスの保証が大変だったりするが、 そのあたりをDelta Lake層で考慮してくれる、などの利点が挙げられる。
Dalta Lake自身が差分管理の仕組みを持っているので、その仕組みを使って読み書きさせるのだろう、という想像。
なお、入力元としてDelta Lakeを想定した場合、「レコードの削除」、「レコードの更新」が発生することが 考えうる。それを入力元としてどう扱うか?を設定するパラメータがある。
- ignoreDeletes: 過去レコードの削除を下流に伝搬しない
- ignoreChanges: 上記に加え、更新されたレコードを含むファイルの内容全体を下流に伝搬させる
出力先としてDelta Lakeを想定した場合、トランザクションの仕組みを用いられるところが特徴となる。 つまり複数のストリーム処理アプリケーションが同じテーブルに出力するときにも適切にハンドルできるようになり、 出力先も含めたExactly Onceを実現可能になる。
Databrciksドキュメントの気になったところのメモ(2019/5時点のメモ)
全体的な注意点として、Databricksのドキュメントなので、Databricksクラウド特有の話が含まれている可能性があることが挙げられる。
データリテンション
データ・リテンション に記述あり。 デフォルトでは30日間のコミットログが保持される、とのこと。 VACUUM句を用いて縮めることができるようだ。
VACUUMについては、VACUUMを参照のこと。
最適化
最適化 に記載がある。コンパクションやZ-Orderingなど。 Databricksクラウド上でSQL文で発行するようだ。
クイックスタートから実装を追ってみる(2019/5時点でのメモ)
公式クイックスタート を参照しながら実装を確認してみる。
上記によると、まずはSBTでは以下の依存関係を追加することになっている。
1
libraryDependencies += "io.delta" %% "delta-core" % "0.1.0"
Create a tableの章 には、バッチ処理での書き込みについて以下のような例が記載されていた。
1 | import org.apache.spark.sql.SparkSession; |
SparkのData Sourcesの仕組みとして扱えるようになっている。
テストコードで言えば、
org/apache/spark/sql/delta/DeltaSuiteOSS.scala:24
あたりを眺めるとよいのではないか。
バッチ方式では、以下のようなテストが実装されている。
1 | test("append then read") { |
ストリーム方式では以下のようなテストが実装されている。
1 | test("append mode") { |
ひとまずRelationを調べて見る
いったんData Source V1だと仮定 1
して、createRelationメソッドを探したところ、
org.apache.spark.sql.delta.sources.DeltaDataSource#createRelation
あたりを眺めると、 実態としては
org/apache/spark/sql/delta/sources/DeltaDataSource.scala:148
1
deltaLog.createRelation()
が戻り値を返しているようだ。
このメソッドは、以下のように内部的にはorg.apache.spark.sql.execution.datasources.HadoopFsRelationクラスを
用いている。というより、うまいことほぼ流用している。
以下のような実装。
org/apache/spark/sql/delta/DeltaLog.scala:600 1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18new HadoopFsRelation(
fileIndex,
partitionSchema = snapshotToUse.metadata.partitionSchema,
dataSchema = snapshotToUse.metadata.schema,
bucketSpec = None,
snapshotToUse.fileFormat,
snapshotToUse.metadata.format.options)(spark) with InsertableRelation {
def insert(data: DataFrame, overwrite: Boolean): Unit = {
val mode = if (overwrite) SaveMode.Overwrite else SaveMode.Append
WriteIntoDelta(
deltaLog = DeltaLog.this,
mode = mode,
new DeltaOptions(Map.empty[String, String], spark.sessionState.conf),
partitionColumns = Seq.empty,
configuration = Map.empty,
data = data).run(spark)
}
}
insertメソッドでDelta
Lake独自の書き込み方式を実行する処理を定義している。
なお、runの中でorg.apache.spark.sql.delta.DeltaOperations内で定義されたWriteオペレーションを実行するように
なっているのだが、そこではorg.apache.spark.sql.delta.OptimisticTransactionを用いるようになっている。
要は、Optimistic Concurrency
Controlの考え方を応用した実装になっているのではないかと想像。 2
※ Delta LakeのOptimistic Concurrency Controlに関する記述 にその旨記載されているようだ。
また、上記の通り、データはDeltaLogクラスを経由して管理される。
実際にデータが書き込まれると思われる
org.apache.spark.sql.delta.commands.WriteIntoDelta#write
を眺めてよう。
最初にメタデータ更新?
org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:87
1
updateMetadata(txn, data, partitionColumns, configuration, isOverwriteOperation)
- スキーマをマージ
- 「パーティションカラム」のチェック(パーティションカラムに指定された名前を持つ「複数のカラム」がないかどうか、など)
- replaceWhereオプション( DataFrameを使った上書き 参照)によるフィルタ構成
★2019/5時点では、ここで調査が止まっていた。これ以降に続く実装調査については、 動作確認しながら実装確認 を参照
Data Source V1とV2
org.apache.spark.sql.delta.sources.DeltaDataSource
あたりがData Source V1向けの実装のエントリポイントか。
これを見る限り、V1で実装されているように見える…?
設定の類
org.apache.spark.sql.delta.sources.DeltaSQLConf
あたりが設定か。
spark.databricks.delta.$keyで指定可能なようだ。
チェックポイントを調査してみる
チェックポイントは、その名の通り、将来のリプレイ時にショートカットするための機能。 スナップショットからチェックポイントを作成する。
エントリポイントは、
org.apache.spark.sql.delta.Checkpoints だろうか。
ひとまず、
org.apache.spark.sql.delta.Checkpoints#checkpoint
メソッドを見つけた。
org/apache/spark/sql/delta/Checkpoints.scala:118 1
2
3
4
5
6
7def checkpoint(): Unit = recordDeltaOperation(this, "delta.checkpoint") {
val checkpointMetaData = checkpoint(snapshot)
val json = JsonUtils.toJson(checkpointMetaData)
store.write(LAST_CHECKPOINT, Iterator(json), overwrite = true)
doLogCleanup()
}
実態は、org.apache.spark.sql.delta.Checkpoints$#writeCheckpoint
メソッドか。
org/apache/spark/sql/delta/Checkpoints.scala:126 1
2
3protected def checkpoint(snapshotToCheckpoint: Snapshot): CheckpointMetaData = {
Checkpoints.writeCheckpoint(spark, this, snapshotToCheckpoint)
}
ちなみに、
org.apache.spark.sql.delta.Checkpoints$#writeCheckpoint
メソッド内ではややトリッキーな方法でチェックポイントの書き出しを行っている。
org.apache.spark.sql.delta.Checkpoints#checkpoint()
メソッドが呼び出されるのは、 以下のようにOptimistic
Transactionのポストコミット処理中である。
org/apache/spark/sql/delta/OptimisticTransaction.scala:294
1
2
3
4
5
6
7
8
9
10
11protected def postCommit(commitVersion: Long, committActions: Seq[Action]): Unit = {
committed = true
if (commitVersion != 0 && commitVersion % deltaLog.checkpointInterval == 0) {
try {
deltaLog.checkpoint()
} catch {
case e: IllegalStateException =>
logWarning("Failed to checkpoint table state.", e)
}
}
}
呼び出されるタイミングは予め設定されたインターバルのパラメータに依存する。
ということは、数回に1回はチェックポイント書き出しが行われるため、そのあたりでパフォーマンス上の影響があるのではないか、と想像される。
スナップショットについて
関連事項として、スナップショットも調査。
スナップショットが作られるタイミングの 一例
としては、org.apache.spark.sql.delta.DeltaLog#updateInternalメソッドが
呼ばれるタイミングが挙げられる。 updateInternalメソッドは
org.apache.spark.sql.delta.DeltaLog#update
メソッド内で呼ばれる。
updateメソッドが呼ばれるタイミングはいくつかあるが、例えばトランザクション開始時に呼ばれる流れも存在する。
つまり、トランザクションを開始する前にはいったんスナップショットが定義されることがわかった。
その他にも、
org.apache.spark.sql.delta.sources.DeltaDataSource#createRelation
メソッドの処理から実行されるケースもある。
このように、いくつかのタイミングでスナップショットが定義(最新化?)されるようになっている。
動作確認しながら実装確認(v0.5.0)
クイックスタートの書き込み
公式ドキュメント(クイックスタート)
を見る限り、 シェルで利用する分には --package などでDelta
Lakeのパッケージを指定すれば良い。
1 | <path to spark home>/bin/spark-shell --packages io.delta:delta-core_2.11:0.5.0 |
クイックスタートの例を実行する。
1 | val data = spark.range(0, 5) |
実際に出力されたParquetファイルは以下の通り。
1 | ls -R /tmp/delta-table/ |
これをデバッガをアタッチして、動作状況を覗いてみることにする。
1 | <path to spark home>/bin/spark-shell --packages io.delta:delta-core_2.11:0.5.0 --driver-java-options -agentlib:jdwp=transport=dt_socket,server=y,suspend=y,address=5005 |
Intellijなどでデバッガをアタッチする。
机上調査があっているか確認するため、
org.apache.spark.sql.delta.sources.DeltaDataSource#createRelation
に ブレイクポイントを設定して動作確認。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:119
1 | val path = parameters.getOrElse("path", { |
パスとパーティション指定するカラムを確認。 上記の例では、
/tmp/delta-table と Nil が戻り値になる。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:126
1 | val deltaLog = DeltaLog.forTable(sqlContext.sparkSession, path) |
DeltaLogのインスタンスを受け取る。
つづいて、
org.apache.spark.sql.delta.commands.WriteIntoDelta#run
メソッドが呼び出される。
src/main/scala/org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:63
1 | override def run(sparkSession: SparkSession): Seq[Row] = { |
withNewTransaction 内で、
org.apache.spark.sql.delta.commands.WriteIntoDelta#writeが呼び出される。
つまり、ここでトランザクションが開始され、下記の記載の通り、最終的にコミットされることになる。
いったん withNewTransaction
の中で行われる処理に着目する。
まずはメタデータ(スキーマ?など?)が更新される。
src/main/scala/org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:85
1 | updateMetadata(txn, data, partitionColumns, configuration, isOverwriteOperation, rearrangeOnly) |
つづいて、"reaplaceWhere" 機能(パーティション列に対し、述語に一致するデータのみを置き換える機能)の フィルタを算出する。
1 | val replaceWhere = options.replaceWhere |
つづいて、
org.apache.spark.sql.delta.files.TransactionalWrite#writeFiles
メソッドが呼び出される。
src/main/scala/org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:105
1 | val newFiles = txn.writeFiles(data, Some(options)) |
内部的には、
org.apache.spark.sql.execution.datasources.FileFormatWriter#write
を用いて 与えられた data (=DataFrame つまり
Dataset)を書き出す処理(物理プラン)を実行する。
ここでのポイントは、割と直接的にSparkのDataSourcesの機能を利用しているところだ。 実装が簡素になる代わりに、Sparkに強く依存していることがわかる。
また、newFilesには出力PATHに作られるファイル群の情報(実際にはcase classのインスタンス)が含まれる。
ここで
org.apache.spark.sql.delta.commands.WriteIntoDelta#write
の呼び出し元、
org.apache.spark.sql.delta.commands.WriteIntoDelta#run
に戻る。
writeが呼ばれたあとは、オペレーション情報がインスタンス化される。
src/main/scala/org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:66
1 | val operation = DeltaOperations.Write(mode, Option(partitionColumns), options.replaceWhere) |
上記のアクションとオペレーション情報を合わせて、以下のようにコミットされる。
src/main/scala/org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:67
1 | txn.commit(actions, operation) |
クイックスタートの読み込み
公式ドキュメント(クイックスタート) には以下のような簡単な例が載っている。
1 | val df = spark.read.format("delta").load("/tmp/delta-table") |
デバッガをアタッチしながら動作を確認しよう。
まず最初の
1 | val df = spark.read.format("delta").load("/tmp/delta-table") |
により、SparkのDataSourceの仕組みに基づいて、リレーションが生成される。
org.apache.spark.sql.delta.sources.DeltaDataSource#createRelation
メソッドあたりを読み解く。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:149
1 | val maybeTimeTravel = |
最初にタイムトラベル対象かどうかを判定する。タイムトラベル自体は別途。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:159
1 | val hadoopPath = new Path(path) |
つづいて、Hadoopの機能を利用し、下回りのデータストアのファイルシステムを取得する。 このあたりでHadoopの機能を利用しているあたりが、HadoopやSparkを前提としたシステムであることがわかる。
また、一貫性を考えると、通常のHadoopやSparkを利用するときと同様に、 S3で一貫性を担保する仕組み(例えばs3a、s3ガードなど)を利用したほうが良いだろう。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:169
1 | val deltaLog = DeltaLog.forTable(sqlContext.sparkSession, rootPath) |
つづいて、DeltaLogインスタンスが生成される。 これにより、ログファイルに対する操作を開始できるようになる。(ここでは読み取りだが、書き込みも対応可能になる)
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:171
1 | val partitionFilters = if (rootPath != hadoopPath) { |
パーティションの読み込みかどうかを検知。 ただし、Delta LakeではパーティションのPATHを直接指定するのは推奨されておらず、where句を使うのが推奨されている。
src/main/scala/org/apache/spark/sql/delta/sources/DeltaDataSource.scala:210
1 | deltaLog.createRelation(partitionFilters, timeTravelByParams.orElse(timeTravelByPath)) |
最後に、実際にリレーションを生成し、戻り値とする。
なお、
org.apache.spark.sql.delta.DeltaLog#createDataFrame
メソッドは以下の通り。
src/main/scala/org/apache/spark/sql/delta/DeltaLog.scala:630
1 | def createRelation( |
TahoeLogFileIndex
なお、生成されたDataFrameのプランを確認すると以下のように表示される。
1 | scala> df.explain |
TahoeLogFileIndex はDelta
Lakeが実装しているFileIndexの一種。
クラス階層は以下の通り。
- TahoeFileIndex (org.apache.spark.sql.delta.files)
- TahoeBatchFileIndex (org.apache.spark.sql.delta.files)
- TahoeLogFileIndex (org.apache.spark.sql.delta.files)
親クラスの TahoeFileIndex は、以下の通り
FileIndexを継承している。
org/apache/spark/sql/delta/files/TahoeFileIndex.scala:35
1 | abstract class TahoeFileIndex( |
TahoeFileIndex のJavaDocには、
A [[FileIndex]] that generates the list of files managed by the Tahoe protocol.
とあり、「Tahoeプロトコル」なるものを通じて、SparkのFileIndex機能を実現する。
例えば、showメソッドを呼び出すと、
1 | scala> df.show() |
実行の途中で、
org.apache.spark.sql.delta.files.TahoeFileIndex#listFiles
メソッドが呼び出される。
以下、listFiles内での動作を軽く確認する。
org/apache/spark/sql/delta/files/TahoeFileIndex.scala:56
1 | matchingFiles(partitionFilters, dataFilters).groupBy(_.partitionValues).map { |
まず、
org.apache.spark.sql.delta.files.TahoeFileIndex#matchingFiles
メソッドが呼ばれ、 AddFile
インスタンスのシーケンスが返される。
org/apache/spark/sql/delta/files/TahoeFileIndex.scala:129
1 | override def matchingFiles( |
上記の通り、戻り値は Seq[AddFile] である。
そこで matchingFiles
メソッドの戻り値をグループ化した後は、mapメソッドにより、
以下のような処理が実行される。
org/apache/spark/sql/delta/files/TahoeFileIndex.scala:57
1 | case (partitionValues, files) => |
参考までに、このとき、 files
には以下のような値が入っている。
1 | files = {WrappedArray$ofRef@19711} "WrappedArray$ofRef" size = 6 |
ここまでが
org.apache.spark.sql.execution.datasources.FileIndex#listFiles
メソッドの内容である。
(参考)TahoeFileIndexがどこから呼ばれるか
ここではSpark v2.4.2を確認する。
org.apache.spark.sql.Dataset#show メソッドでは、内部的に
org.apache.spark.sql.Dataset#showString
メソッドを呼び出す。
org/apache/spark/sql/Dataset.scala:744
1 | def show(numRows: Int, truncate: Boolean): Unit = if (truncate) { |
org.apache.spark.sql.Dataset#showString メソッド内で、
org.apache.spark.sql.Dataset#getRows
メソッドが呼ばれる。
org/apache/spark/sql/Dataset.scala:285
1 | private[sql] def showString( |
org.apache.spark.sql.Dataset#getRows メソッド内では、
org.apache.spark.sql.Dataset#take メソッドが呼ばれる。
org/apache/spark/sql/Dataset.scala:241
1 | private[sql] def getRows( |
org.apache.spark.sql.Dataset#take メソッドでは
org.apache.spark.sql.Dataset#head(int)
メソッドが呼ばれる。
org/apache/spark/sql/Dataset.scala:2758
1 | def take(n: Int): Array[T] = head(n) |
org.apache.spark.sql.Dataset#head メソッド内で、
org.apache.spark.sql.Dataset#withAction を用いて、
org.apache.spark.sql.Dataset#collectFromPlan
メソッドが呼ばれる。
org/apache/spark/sql/Dataset.scala:2544
1 | def head(n: Int): Array[T] = withAction("head", limit(n).queryExecution)(collectFromPlan) |
org.apache.spark.sql.Dataset#collectFromPlan
メソッド内で
org.apache.spark.sql.execution.SparkPlan#executeCollect
メソッドが呼ばれる。
org/apache/spark/sql/Dataset.scala:3379
1 | private def collectFromPlan(plan: SparkPlan): Array[T] = { |
なお、 org.apache.spark.sql.execution.CollectLimitExec
のcase classインスタンス化の中で、
org.apache.spark.sql.execution.CollectLimitExec#executeCollect
が以下のように定義されている。
org/apache/spark/sql/execution/limit.scala:35
1 | case class CollectLimitExec(limit: Int, child: SparkPlan) extends UnaryExecNode { |
そこで、
org.apache.spark.sql.execution.SparkPlan#executeTake
メソッドに着目していく。 当該メソッド内で、
org.apache.spark.sql.execution.SparkPlan#getByteArrayRdd
メソッドが呼ばれ、 childRDD が生成される。
org/apache/spark/sql/execution/SparkPlan.scala:334
1 | def executeTake(n: Int): Array[InternalRow] = { |
org.apache.spark.sql.execution.SparkPlan#getByteArrayRdd
メソッドの実装は以下の通りで、 内部的に
org.apache.spark.sql.execution.SparkPlan#execute
メソッドが呼ばれる。
1 | private def getByteArrayRdd(n: Int = -1): RDD[(Long, Array[Byte])] = { |
org.apache.spark.sql.execution.SparkPlan#execute
メソッド内で
org.apache.spark.sql.execution.SparkPlan#executeQuery
を利用し、
その内部でorg.apache.spark.sql.execution.SparkPlan#doExecute
メソッドが呼ばれる。
org/apache/spark/sql/execution/SparkPlan.scala:127
1 | final def execute(): RDD[InternalRow] = executeQuery { |
参考までに、org.apache.spark.sql.execution.SparkPlan#executeQuery
内では、 org.apache.spark.rdd.RDDOperationScope#withScope
を使ってクエリが実行される。
org/apache/spark/sql/execution/SparkPlan.scala:151
1 | protected final def executeQuery[T](query: => T): T = { |
つづいて、 doExecute メソッドの確認に戻る。
org.apache.spark.sql.execution.WholeStageCodegenExec#doExecute
メソッド内で、
org.apache.spark.sql.execution.CodegenSupport#inputRDDs
メソッドが呼ばれる。
1 | override def doExecute(): RDD[InternalRow] = { |
inputRDDs メソッド内でinputRDDが呼び出される。
org/apache/spark/sql/execution/DataSourceScanExec.scala:326
1 | override def inputRDDs(): Seq[RDD[InternalRow]] = { |
inputRDD にRDDインスタンスをバインドする際、その中で
org.apache.spark.sql.execution.FileSourceScanExec#createNonBucketedReadRDD
メソッドが呼ばれ、 そこに渡される readFile
メソッドが実行される。
org/apache/spark/sql/execution/DataSourceScanExec.scala:305
1 | private lazy val inputRDD: RDD[InternalRow] = { |
readFile メソッドを一緒に
org.apache.spark.sql.execution.FileSourceScanExec#createNonBucketedReadRDD
メソッドに渡されている
org.apache.spark.sql.execution.FileSourceScanExec#selectedPartitions
は以下のように定義される。 Seq[PartitionDirectory]
のインスタンスを selectedPartitions にバインドする際に、
org.apache.spark.sql.execution.datasources.FileIndex#listFiles
メソッドが呼び出される。
org/apache/spark/sql/execution/DataSourceScanExec.scala:190
1 | @transient private lazy val selectedPartitions: Seq[PartitionDirectory] = { |
このとき、具象クラス側の listFiles
メソッドが呼ばれることになるが、 TahoeLogFileIndex
クラスの場合は、親クラスのメソッド
org.apache.spark.sql.delta.files.TahoeFileIndex#listFiles
が呼ばれる。 当該メソッドの内容は、上記で示したとおり。
クイックスタートの更新時
公式ドキュメント(クイックスタート) には 以下のような例が載っている。
1 | val data = spark.range(5, 10) |
上記を実行した際のデータ保存ディレクトリの構成は以下の通り。
1 | ls -R /tmp/delta-table/ |
00000000000000000001.json の内容は以下の通り。
1 | { |
確かに上書きモードで書き込まれたことが確かめられる。
このモードは、例えば
org.apache.spark.sql.delta.commands.WriteIntoDelta
で用いられる。 上記の
1 | data.write.format("delta").mode("overwrite").save("/tmp/delta-table") |
が呼ばれるときに、内部的に
org.apache.spark.sql.delta.commands.WriteIntoDelta#run
メソッドが呼ばれ、 以下のように、 mode が渡される。
org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:63
1 | override def run(sparkSession: SparkSession): Seq[Row] = { |
なお、overwriteモードを指定しないと、 mode には
ErrorIfExists が渡される。 モードの詳細は、enum
org.apache.spark.sql.SaveMode (Spark SQL)を参照。
(例えば、他にも append や Ignore
あたりも指定可能そうではある)
クイックスタートのストリームデータ読み書き
公式ドキュメント(クイックスタート) には以下の例が載っていた。
1 | scala> val streamingDf = spark.readStream.format("rate").load() |
別のターミナルを開き、Sparkシェルを開き、以下でデータを読み込む。
1 | scala> val df = spark.read.format("delta").load("/tmp/delta-table") |
裏でストリームデータを書き込んでいるので、適当に間をおいてcountを実行するとレコード数が増えていることが確かめられる。
1 | scala> df.count |
1 | scala> df.groupBy("id").count.sort($"count".desc).show |
止めるには、ストリーム処理を実行しているターミナルで以下を実行。
1 | scala> stream.stop() |
上記だと面白くないので、次に実行する処理内容を少しだけ修正。10で割った余りとするようにした。
1 | scala> val stream = streamingDf.select($"value" % 10 as "id").writeStream.format("delta").option("checkpointLocation", "/tmp/checkpoint").start("/tmp/delta-table") |
結果は以下の通り。先程書き込んだデータも含まれているので、 件数が1個のデータと、いま書き込んでいる10で割った余りのデータが混在しているように見えるはず。
1 | scala> df.groupBy("id").count.sort($"count".desc).show |
つづいてドキュメントに載っているストリームとしての読み取りを試す。
1 | scala> val stream2 = spark.readStream.format("delta").load("/tmp/delta-table").writeStream.format("console").start() |
以下のような表示がコンソールに出るはず。
1 | ------------------------------------------- |
それぞれ止めておく。
1 | scala> stream.stop() |
1 | scala> stream2.stop() |
さて、まず書き込み時の動作を確認する。
上記の例で言うと、ストリーム処理を定義し、スタートすると、
1 | scala> val stream = streamingDf.select($"value" as "id").writeStream.format("delta").option("checkpointLocation", "/tmp/checkpoint").start("/tmp/delta-table") |
以下の
org.apache.spark.sql.delta.sources.DeltaDataSource#createSink
メソッドが呼ばれる。
org/apache/spark/sql/delta/sources/DeltaDataSource.scala:99
1 | override def createSink( |
上記の通り、実態は
org.apache.spark.sql.delta.sources.DeltaSink クラスである。
当該クラスはSpark Structured Streamingの
org.apache.spark.sql.execution.streaming.Sink
トレートを継承(ミックスイン)している。
org.apache.spark.sql.delta.sources.DeltaSink#addBatch
メソッドが、実際にシンクにバッチを追加する処理を規定している。
org/apache/spark/sql/delta/sources/DeltaSink.scala:50
1 | override def addBatch(batchId: Long, data: DataFrame): Unit = deltaLog.withNewTransaction { txn => |
上記のように、
org.apache.spark.sql.delta.DeltaLog#withNewTransaction
メソッドを用いてトランザクションが開始される。
また引数には、バッチのユニークなIDと書き込み対象のDataFrameが含まれる。
このまま、軽く
org.apache.spark.sql.delta.sources.DeltaSink#addBatch
の内容を確認する。 以下、順に記載。
org/apache/spark/sql/delta/sources/DeltaSink.scala:63
1 | val selfScan = data.queryExecution.analyzed.collectFirst { |
この書き込み時に、同時に読み込みをしているかどうかを確認。 (トランザクション制御の関係で・・・)
org/apache/spark/sql/delta/sources/DeltaSink.scala:71
1 | updateMetadata( |
メタデータ更新。
org/apache/spark/sql/delta/sources/DeltaSink.scala:78
1 | val currentVersion = txn.txnVersion(queryId) |
バッチが重なっていないかどうかを確認。
org/apache/spark/sql/delta/sources/DeltaSink.scala:84
1 | val deletedFiles = outputMode match { |
削除対象ファイルを確認。 なお、ここで記載している例においてはモードがAppendなので、値がNilになる。
org/apache/spark/sql/delta/sources/DeltaSink.scala:90
1 | val newFiles = txn.writeFiles(data, Some(options)) |
つづいて、ファイルを書き込み。 ちなみに、書き込まれたファイル情報が戻り値として得られる。 内容は以下のような感じ。
1 | newFiles = {ArrayBuffer@20585} "ArrayBuffer" size = 7 |
実際に更新されたファイルを確認すると以下の通り。
1 | $ ls -lt /tmp/delta-table/ | head |
では実装確認に戻る。
org/apache/spark/sql/delta/sources/DeltaSink.scala:91
1 | val setTxn = SetTransaction(queryId, batchId, Some(deltaLog.clock.getTimeMillis())) :: Nil |
トランザクションをコミットすると、 _delta_log
以下のファイルも更新される。
次は、読み込みの動作を確認する。
読み込み時は、
org.apache.spark.sql.delta.sources.DeltaSource#getBatch
メソッドが呼ばれ、 バッチが取得される。
org/apache/spark/sql/delta/sources/DeltaSource.scala:273
1 | override def getBatch(start: Option[Offset], end: Offset): DataFrame = { |
ここでは
org.apache.spark.sql.delta.sources.DeltaSource#getBatch
メソッド内の処理を確認する。
org/apache/spark/sql/delta/sources/DeltaSource.scala:274
1 | val endOffset = DeltaSourceOffset(tableId, end) |
最初に、当該バッチの終わりの位置を示すオフセットを算出する。
org/apache/spark/sql/delta/sources/DeltaSource.scala:276
1 | val changes = if (start.isEmpty) { |
上記の通り、
org.apache.spark.sql.delta.sources.DeltaSource#getChanges
メソッドを使って
org.apache.spark.sql.delta.sources.IndexedFile
インスタンスのイテレータを受け取る。 特に初回のバッチでは変数
start が None
であり、さらにスナップショットから開始するようになる。
なお、初回では無い場合は、以下が実行される。
org/apache/spark/sql/delta/sources/DeltaSource.scala:285
1 | } else { |
与えられたオフセット情報を元に
org.apache.spark.sql.delta.sources.DeltaSourceOffset
をインスタンス化し、それを用いてイテレータを生成する。
org/apache/spark/sql/delta/sources/DeltaSource.scala:294
1 | val addFilesIter = changes.takeWhile { case IndexedFile(version, index, _, _) => |
上記で得られたイテレータをベースに、 AddFile
インスタンスのシーケンスを得る。
1 | logDebug(s"start: $start end: $end ${addFiles.toList}") |
org.apache.spark.sql.delta.DeltaLog#createDataFrame
メソッドを使って、今回のバッチ向けのDataFrameを得る。
(参考)DeltaSinkのaddBatchメソッドがどこから呼ばれるか。
Sparkの
org.apache.spark.sql.execution.streaming.MicroBatchExecution#runBatch
メソッド内で呼ばれる。
org/apache/spark/sql/execution/streaming/MicroBatchExecution.scala:534
1 | reportTimeTaken("addBatch") { |
なお、ここで渡されている nextBatch
は、その直前で以下のように生成される。
org/apache/spark/sql/execution/streaming/MicroBatchExecution.scala:531
1 | val nextBatch = |
なお、ほぼ自明であるが、上記例において nextBatch
で渡されるバッチのクエリプランは以下のとおりである。
1 | *(1) Project [value#684L AS id#4L] |
org.apache.spark.sql.execution.streaming.MicroBatchExecution#runBatch
メソッド自体は、
org.apache.spark.sql.execution.streaming.MicroBatchExecution#runActivatedStream
メソッド内で呼ばれる。 すなわち、
org.apache.spark.sql.execution.streaming.StreamExecution
クラス内で管理される、ストリーム処理を実行する仕組みの中で、
繰り返し呼ばれることになる。
スキーマバリデーション
公式ドキュメントのスキーマバリデーション には書き込みの際のスキーマ確認のアルゴリズムが載っている。
原則はカラムや型が一致することを求める。違っていたら例外が上がる。
また大文字小文字だけが異なるカラムを用ってはいけない。
試しに例外を出してみる
試しにスキーマの異なるレコードを追加しようと試みてみた。 ここでは、保存されているDelta Lakeテーブルには存在しない列を追加したデータを書き込もうとしてみる。
1 | scala> // テーブルの準備 |
以下のようなエラーが生じた。
1 | scala> newRecords.write.format("delta").mode("append").save("/tmp/delta-table") |
上記エラーは、
org.apache.spark.sql.delta.MetadataMismatchErrorBuilder#addSchemaMismatch
メソッド内で 生成されたものである。
org/apache/spark/sql/delta/DeltaErrors.scala:810
1 | def addSchemaMismatch(original: StructType, data: StructType): Unit = { |
上記の通り、Before /
Afterでスキーマを表示してくれるようになっている。 このメソッドは、
org.apache.spark.sql.delta.schema.ImplicitMetadataOperation#updateMetadata
メソッド内で 呼ばれる。
org/apache/spark/sql/delta/schema/ImplicitMetadataOperation.scala:113
1 | if (isNewSchema) { |
ここで isNewSchema
は現在のスキーマと新たに渡されたデータの
スキーマが一致しているかどうかを示す変数。
org/apache/spark/sql/delta/schema/ImplicitMetadataOperation.scala:57
1 | val dataSchema = data.schema.asNullable |
上記の通り、overwriteモードでスキーマのオーバライトが可能なときは、新しいデータのスキーマが有効。
そうでない場合は、
org.apache.spark.sql.delta.schema.SchemaUtils$#mergeSchemas
メソッドを使って 改めてスキーマが確定する。
自動でのカラム追加(スキーマ変更)を試す
公式ドキュメントのスキーママージ に記載があるとおり試す。
上記の例外が出た例に対し、以下のexpressionは成功する。
1 | scala> // テーブルの準備 |
org.apache.spark.sql.delta.schema.ImplicitMetadataOperation#updateMetadata
メソッドの内容を確認する。
org/apache/spark/sql/delta/schema/ImplicitMetadataOperation.scala:57
1 | val dataSchema = data.schema.asNullable |
上記expressionを実行した際、まず dataSchema
には、以下のような値が含まれている。
つまり、新しく渡されたレコードのスキーマである。
1 | dataSchema = {StructType@16480} "StructType" size = 3 |
一方、 txn.metadata.schema
には以下のような値が含まれている。
つまり、書き込み先のテーブルのスキーマである。
1 | result = {StructType@19866} "StructType" size = 2 |
org.apache.spark.sql.delta.schema.SchemaUtils$#mergeSchemas
メソッドによりマージされたスキーマ mergedSchema は、
1 | result = {StructType@16487} "StructType" size = 3 |
となる。
したがって、 isNewSchema メソッドの戻り値は
true となる。
1 | def isNewSchema: Boolean = txn.metadata.schema != mergedSchema |
実際には
- overwriteモードかどうか
- 新しいパーティショニングが必要かどうか
- スキーマが変わるかどうか
に依存して処理が分かれるが、今回のケースでは以下のようにメタデータが更新される。
org/apache/spark/sql/delta/schema/ImplicitMetadataOperation.scala:103
1 | } else if (isNewSchema && canMergeSchema && !isNewPartitioning) { |
overwriteモード時のスキーマ上書き
公式ドキュメントのスキーマ上書き に記載の通り、overwriteモードのとき、デフォルトではスキーマを更新しない。 したがって以下のexpressionは例外を生じる。
1 | scala> // テーブルの準備 |
option("overwriteSchema", "true")
をつけると、overwriteモード時にスキーマの異なるデータで上書きするとき、例外を生じなくなる。
1 | scala> // テーブルの準備 |
つまり、
- overwriteモード
- スキーマ上書き可能
- 新しいスキーマ
という条件の下で、以下のようにメタデータが更新される。
org/apache/spark/sql/delta/schema/ImplicitMetadataOperation.scala:91
1 | } else if (isOverwriteMode && canOverwriteSchema && (isNewSchema || isNewPartitioning)) { |
パーティション
公式ドキュメントのパーティション説明 には、以下のような例が載っている。
1 | scala> df.write.format("delta").partitionBy("date").save("/delta/events") |
特にパーティションを指定せずに実行すると以下のようになる。
1 | scala> val id = spark.range(0, 100000) |
1 | ls -1 /tmp/delta-table/ |
Parquetファイルが出力ディレクトリに直接置かれる。
つづいてパーティションカラムを指定して書き込み。
1 | scala> data.write.format("delta").partitionBy("rand").save("/tmp/delta-table-partitioned") |
1 | ls -1 -R /tmp/delta-table-partitioned/ |
先程指定したカラムの値に基づき、パーティション化されていることがわかる。
なお、メタデータ(
/tmp/delta-table-partitioned/_delta_log/00000000000000000000.json
内でも以下のようにパーティションカラムが指定されたことが示されてる。
1 | {"commitInfo":{"timestamp":1583070456680,"operation":"WRITE","operationParameters":{"mode":"ErrorIfExists","partitionBy":"[\"rand\"]"},"isBlindAppend":true}} |
Delta Table
公式ドキュメント(クイックスタート) にも記載あるが、データをテーブル形式で操作できる。 上記で掲載されている例は以下の通り。
1 | import io.delta.tables._ |
なお、 io.delta.tables.DeltaTable
クラスの実態は、Dataset(DataFrame)とそれを操作するためのAPIの塊である。
例えば上記の
io.delta.tables.DeltaTable#forPath
メソッドは以下のように定義されている。
1 | def forPath(sparkSession: SparkSession, path: String): DeltaTable = { |
条件でレコード削除
1 | scala> // データ準備 |
なお、 io.delta.tables.DeltaTable#delete
メソッドの実態は、
io.delta.tables.execution.DeltaTableOperations#executeDelete
メソッドである。
コメントで、
// current DELETE does not support subquery, // and the reason why perform checking here is that // we want to have more meaningful exception messages, // instead of having some random msg generated by executePlan().
と記載されており、バージョン0.5.0の段階ではサブクエリを使った削除には対応していないようだ。
またドキュメントによると、
delete removes the data from the latest version of the Delta table but does not remove it from the physical storage until the old versions are explicitly vacuumed. See vacuum for more details.
とあり、不要になったファイルはバキュームで削除されるとのこと。
更新
1 | scala> // データ準備 |
元のデータが
1 | scala> deltaTable.toDF.show |
だとすると、
1 | scala> deltaTable.toDF.show |
のようになる。
io.delta.tables.DeltaTable#updateExpr メソッドの実態は、
io.delta.tables.execution.DeltaTableOperations#executeUpdate
メソッドである。
upsert(マージ)
1 | scala> // データ準備 |
まず元データには、99999より大きな値はない。
1 | > deltaTable.toDF.filter($"id" > 99997).show |
元データの先頭は以下の通り。
1 | scala> deltaTable.toDF.show |
upsert用のデータは以下の通り。
1 | scala> dataForUpsert.show |
99999よりも大きな id も存在する。
1 | scala> dataForUpsert.filter($"id" > 99997).show |
upseart(マージ)を実行すると、
1 | scala> deltaTable.toDF.orderBy($"id").show |
上記のように、既存のレコードについては値が更新された。 3
また、
1 | scala> deltaTable.toDF.filter($"id" > 99997).show |
のように、99997よりも大きな id
のレコードも存在することがわかる。
io.delta.tables.DeltaTable#merge
上記の例に載っていた io.delta.tables.DeltaTable#merge
を確認する。
io/delta/tables/DeltaTable.scala:501
1 | def merge(source: DataFrame, condition: Column): DeltaMergeBuilder = { |
io.delta.tables.DeltaMergeBuilder
はマージのロジックを構成するためのクラス。
- whenMatched
- whenNotMatched
メソッドが提供されており、それぞれマージの条件が合致した場合、合致しなかった場合に実行する処理を指定可能。 なお、それぞれメソッドの引数にString型の変数を渡すことができる。 その場合、マージの条件に 加えて さらに条件を加えられる。
なお、 whenNotMatched に引数を与えた場合は、
- マージ条件に合致しなかった
- 引数で与えられた条件に合致した
が成り立つ場合に有効である。
whenMatched の場合は戻り値は
io.delta.tables.DeltaMergeMatchedActionBuilder である。
io.delta.tables.DeltaMergeMatchedActionBuilder クラスには
update メソッド、 udpateExpr、
updateAll、 delete メソッドがあり、
条件に合致したときに実行する処理を定義できる。
例えば、 update メソッドは以下の通り。
io/delta/tables/DeltaMergeBuilder.scala:298
1 | def update(set: Map[String, Column]): DeltaMergeBuilder = { |
io/delta/tables/DeltaMergeBuilder.scala:365
1 | private def addUpdateClause(set: Map[String, Column]): DeltaMergeBuilder = { |
戻り値は上記の通り、 io.delta.tables.DeltaMergeBuilder
になる。 当該クラスは、メンバに whenClauses
を持ち、指定された更新用の式(のセット)を保持する。
io/delta/tables/DeltaMergeBuilder.scala:244
1 | private[delta] def withClause(clause: MergeIntoClause): DeltaMergeBuilder = { |
なお、最後に execute メソッドを確認する。
io/delta/tables/DeltaMergeBuilder.scala:225
1 | def execute(): Unit = { |
最初に、DataFrameの変換前後の実行プラン、マージの際の条件等から マージの実行プランを作成する。 ★要確認
参考)値がユニークではないカラムを使ってのマージ
値がユニークではないカラムを使ってマージしようとすると、以下のようなエラーを生じる。
1 | java.lang.UnsupportedOperationException: Cannot perform MERGE as multiple source rows matched and attempted to update the same |
つまり、上記の例では dataForUpsert
の中に、万が一重複する id
をもつレコードが含まれていると、例外を生じることになる。
これは、重複する id
について、どの値を採用したらよいか断定できなくなるため。
実装上は、
org.apache.spark.sql.delta.commands.MergeIntoCommand#findTouchedFiles
メソッド内で重複の確認が行われる。 以下の通り。
org/apache/spark/sql/delta/commands/MergeIntoCommand.scala:223
1 | val matchedRowCounts = collectTouchedFiles.groupBy(ROW_ID_COL).agg(sum("one").as("count")) |
対象のカラムでgroupByして件数を数えていることがわかる。
最も容易に再現する方法は、
val dataForUpsert = data2.sample(false, 0.5)
の第1引数をtrueにすれば、おそらく再現する。
マージの例
公式ドキュメントのマージの例 に有用な例が載っている。
- 公式ドキュメントのマージを使った上書き
- ログなどを収集する際、データソース側で重複させることがある。Delta Lakeのテーブルにマージしながら入力することで、 レコード重複を排除しながらテーブルの内容を更新できる
- さらに、新しいデータをマージする際、マージすべきデータの範囲がわかっていれば(例:最近7日間のログなど)、 それを使ってスキャン・書き換えの範囲を絞りこめる。
- Slowly
changing data (SCD) Type 2 operation
- Dimensionalなデータを断続的にゆっくりと更新するワークロード
- 新しい値で更新するときに、古い値を残しておく
- Write
change data into a Delta table
- 外部テーブルの変更をDelta Lakeに取り込む
- DataFrame内にキー、タイムスタンプ、新しい値、削除フラグを持つ「変更内容」を表すレコードを保持。
- 上記DataFrameには、あるキーに関する変更を複数含む可能性があるため、キーごとに一度アグリゲートし、 グループごとに最も新しい変更内容を採用する。
- DeltaTableのmerge機能を利用してupsert(や削除)する。
- Upsert
from streaming queries using foreachBatch
- org.apache.spark.sql.streaming.DataStreamWriter#foreachBatch を用いて、ストリームの各マイクロバッチに対する、 Delta Lakeのマージ処理を行う。
- CDCの方法と組み合わせ、重複排除(ユニークID利用、マイクロバッチのIDが使える?)との組み合わせも可能
タイムトラベル
Deltaの持つヒストリは、上記の DeltaTable
を利用して見られる。(その他にも、メタデータを直接確認する、という手もあるはある)
1 | scala> val deltaTable = DeltaTable.forPath("/tmp/delta-table") |
このうち、readVersionを指定し、ロードすることもできる。
1 | scala> spark.read.format("delta").option("versionAsOf", 8).load("/tmp/delta-table").show |
ここで指定した versionAsOf の値は、
org.apache.spark.sql.delta.sources.DeltaDataSource
内で用いられる。
org.apache.spark.sql.delta.sources.DeltaDataSource#createRelation
メソッド内に以下のような実装があり、
ここでタイムトラベルの値が読み込まれる。
org/apache/spark/sql/delta/sources/DeltaDataSource.scala:153
1 | val timeTravelByParams = getTimeTravelVersion(parameters) |
その他にもタイムスタンプで指定する方法もある。
公式ドキュメント の例:
1 | df1 = spark.read.format("delta").option("timestampAsOf", timestamp_string).load("/delta/events") |
なお、 公式ドキュメント には以下のような記載が見られた。
This sample code writes out the data in df, validates that it all falls within the specified partitions, and performs an atomic replacement.
これは、データ本体を書き出してから、メタデータを新規作成することでアトミックに更新することを示していると想像される。
org.apache.spark.sql.delta.OptimisticTransactionImpl#commit
メソッドあたりを確認したら良さそう。
org.apache.spark.sql.delta.OptimisticTransactionImpl#commit
org.apache.spark.sql.delta.OptimisticTransactionImpl#commit
メソッドは、 例えば
org.apache.spark.sql.delta.commands.WriteIntoDelta#run
メソッド内で呼ばれる。
org/apache/spark/sql/delta/commands/WriteIntoDelta.scala:63
1 | override def run(sparkSession: SparkSession): Seq[Row] = { |
Delta Logを書き出した後に、メタデータを更新し書き出したDelta Logを有効化する。 書き込み衝突検知なども行われる。
org/apache/spark/sql/delta/OptimisticTransaction.scala:250
1 | def commit(actions: Seq[Action], op: DeltaOperations.Operation): Long = recordDeltaOperation( |
commitメソッドは上記の通り、 Action と
Operation を引数に取る。
- Action: Delta Tableに対する変更内容を表す。Actionのシーケンスがテーブル更新の内容を表す。
- Operation: Delta Tableに対する操作を表す。必ずしもテーブル内容の更新を示すわけではない。
なお、Operationの子クラスは以下の通り。
- ManualUpdate$ in DeltaOperations$ (org.apache.spark.sql.delta)
- UnsetTableProperties in DeltaOperations$ (org.apache.spark.sql.delta)
- Write in DeltaOperations$ (org.apache.spark.sql.delta)
- Convert in DeltaOperations$ (org.apache.spark.sql.delta)
- UpgradeProtocol in DeltaOperations$ (org.apache.spark.sql.delta)
- ComputeStats in DeltaOperations$ (org.apache.spark.sql.delta)
- SetTableProperties in DeltaOperations$ (org.apache.spark.sql.delta)
- FileNotificationRetention$ in DeltaOperations$ (org.apache.spark.sql.delta)
- Update in DeltaOperations$ (org.apache.spark.sql.delta)
- ReplaceTable in DeltaOperations$ (org.apache.spark.sql.delta)
- Truncate in DeltaOperations$ (org.apache.spark.sql.delta)
- Fsck in DeltaOperations$ (org.apache.spark.sql.delta)
- CreateTable in DeltaOperations$ (org.apache.spark.sql.delta)
- Merge in DeltaOperations$ (org.apache.spark.sql.delta)
- Optimize in DeltaOperations$ (org.apache.spark.sql.delta)
- ReplaceColumns in DeltaOperations$ (org.apache.spark.sql.delta)
- UpdateColumnMetadata in DeltaOperations$ (org.apache.spark.sql.delta)
- StreamingUpdate in DeltaOperations$ (org.apache.spark.sql.delta)
- Delete in DeltaOperations$ (org.apache.spark.sql.delta)
- ChangeColumn in DeltaOperations$ (org.apache.spark.sql.delta)
- ResetZCubeInfo in DeltaOperations$ (org.apache.spark.sql.delta)
- UpdateSchema in DeltaOperations$ (org.apache.spark.sql.delta)
- AddColumns in DeltaOperations$ (org.apache.spark.sql.delta)
では commit メソッドの内容確認に戻る。
org/apache/spark/sql/delta/OptimisticTransaction.scala:253
1 | val version = try { |
最初に、
org.apache.spark.sql.delta.OptimisticTransactionImpl#prepareCommit
メソッドを利用し準備する。 例えば、
- メタデータ更新が一度に複数予定されていないか
- 最初の書き込みか?必要に応じて出力先ディレクトリを作り、初期のプロトコルバージョンを決める、など。
- 不要なファイルの削除
ここで「プロトコルバージョン」と言っているのは、クライアントが書き込みする際に使用するプロトコルのバージョンである。 つまり、テーブルに後方互換性を崩すような変更があった際、最小プロトコルバージョンを規定することで、 古すぎるクライアントのアクセスを許さないような仕組みが、Delta Lakeには備わっている。
では commit メソッドの内容確認に戻る。
org/apache/spark/sql/delta/OptimisticTransaction.scala:257
1 | // Find the isolation level to use for this commit |
書き込みファイル衝突時のアイソレーションレベルの確認。 なお、上記では実際には
- データ変更なし:
SnapshotIsolation - データ変更あり:
Serializable
とされている。詳しくは #アイソレーションレベル を参照。
(WIP)
プロトコルバージョン
あとで書く。
アイソレーションレベル
Delta
Lakeは楽観ロックの仕組みであるが、3種類のアイソレーションレベルが用いられることになっている。(使い分けられることになっている)
DeltaTableのコンストラクタに、 delta
ソースとして読み込んだDataFrameが渡されていることがわかる。 *
org.apache.spark.sql.delta.Serializable *
org.apache.spark.sql.delta.WriteSerializable *
org.apache.spark.sql.delta.SnapshotIsolation
org.apache.spark.sql.delta.OptimisticTransactionImpl#commit
メソッド内では
以下のようにデータ変更があるかどうかでアイソレーションレベルを使い分けるようになっている。
src/main/scala/org/apache/spark/sql/delta/OptimisticTransaction.scala:259
1 | val isolationLevelToUse = if (noDataChanged) { |
また、実際に上記アイソレーションレベルの設定が用いられるのは、
org.apache.spark.sql.delta.OptimisticTransactionImpl#doCommit
メソッドである。
src/main/scala/org/apache/spark/sql/delta/OptimisticTransaction.scala:293
1 | val commitVersion = doCommit(snapshot.version + 1, finalActions, 0, isolationLevelToUse) |
org.apache.spark.sql.delta.OptimisticTransactionImpl#doCommit
メソッドでは、 tryを用いてデルタログのストアファイルに書き込む。
1 | private def doCommit( |
ここで java.nio.file.FileAlreadyExistsException
が発生すると、先程のアイソレーションレベルに
基づいた処理が行われることになる。
これは、楽観ロックであるため、いざ書き込もうとしたら「あ、デルタログのストアファイルが、誰かに書き込まれている…」ということが
ありえるからある。
1 | } catch { |
上記の
org.apache.spark.sql.delta.OptimisticTransactionImpl#checkAndRetry
メソッドの内容を確認する。
org/apache/spark/sql/delta/OptimisticTransaction.scala:442
1 | protected def checkAndRetry( |
最初に現在の最新のDeltaログのバージョン確認。 これをもとに、チェックするべきバージョン、つまりトランザクションを始めてから、 更新された内容をトラックする。
以下の通り。
org/apache/spark/sql/delta/OptimisticTransaction.scala:453
1 | (checkVersion until nextAttemptVersion).foreach { version => |
上記で、トランザクション開始後のアクションを確認できる。
org/apache/spark/sql/delta/OptimisticTransaction.scala:460
1 | val metadataUpdates = winningCommitActions.collect { case a: Metadata => a } |
この後の処理のため、アクションから各種情報を取り出す。
org/apache/spark/sql/delta/OptimisticTransaction.scala:467
1 | val blindAppendAddedFiles = mutable.ArrayBuffer[AddFile]() |
まず、変更のあったファイルを確認する。 このとき、既存ファイルに関係なく書き込まれた(blind append)ファイルか、 そうでないかを仕分けながら確認する。 一応、後々アイソレーションレベルに基づいてファイルを処理する際に、 ここで得られた情報が用いられる。 4
org/apache/spark/sql/delta/OptimisticTransaction.scala:479
1 | if (protocol.nonEmpty) { |
プロトコル変更がないかどうかを確認する。
org/apache/spark/sql/delta/OptimisticTransaction.scala:491
1 | if (metadataUpdates.nonEmpty) { |
メタデータに変更があったら例外。 つまり、トランザクション開始後、例えばスキーマ変更があったら例外になる、ということ。 スキーマ上書きを有効化した上でカラム追加を伴うような書き込みを行った際にメタデータが変わるため、 他のトランザクションからそのような書き込みがあった場合は、例外になることになる。
src/main/scala/org/apache/spark/sql/delta/OptimisticTransaction.scala:496
1 | val addedFilesToCheckForConflicts = commitIsolationLevel match { |
アイソレーションレベルに基づいて、競合確認する対象ファイルを決める。
なお、前述の通り、実際にはデータの変更のありなしでアイソレーションレベルが変わるようになっている。 具体的には、
- データ変更あり:Serializable
- データ変更なし:SnapshotIsolation
となっており、いまの実装ではWriteSerializableは用いられないようにみえる。
org.apache.spark.sql.delta.IsolationLevel
にもそのような旨の記載がある。
org/apache/spark/sql/delta/isolationLevels.scala:83
1 | /** All the valid isolation levels that can be specified as the table isolation level */ |
では、データの変更あり・なしは、どうやって設定されるのかというと、
dataChange というオプションで指定することになる。
データ変更なしの書き込みはいつ使われるのか、というと、 例えば「たくさん作られたDelta Lakeのファイルをまとめる(Compactする)とき」である。
説明が 公式ドキュメントのCompact filesの説明 にある。 ドキュメントの例では以下のようにオプションが指定されている。
1 | val path = "..." |
例外処理の内容確認に戻る。
org/apache/spark/sql/delta/OptimisticTransaction.scala:496
1 | val addedFilesToCheckForConflicts = commitIsolationLevel match { |
Delta Lakeバージョン0.5.0では、今回のトランザクションで書き込みがある場合は既存ファイルに影響ない書き込みを含め、すべて確認対象とする。 そうでない場合は確認対象は空である。
org/apache/spark/sql/delta/OptimisticTransaction.scala:501
1 | val predicatesMatchingAddedFiles = ExpressionSet(readPredicates).iterator.flatMap { p => |
トランザクション中に、別のトランザクションによりファイルが追加された場合、関係するパーティション情報を取得。
org/apache/spark/sql/delta/OptimisticTransaction.scala:509
1 | if (predicatesMatchingAddedFiles.nonEmpty) { |
当該パーティション情報がから出ない場合は、例外
org.apache.spark.sql.delta.ConcurrentAppendException#ConcurrentAppendException
が生じる。
つづいて、上記でないケースのうち、削除が行われたケース。
org/apache/spark/sql/delta/OptimisticTransaction.scala:527
1 | val readFilePaths = readFiles.map(f => f.path -> f.partitionValues).toMap |
読もうとしたファイルが他のトランザクションにより削除された倍は、 例外
org.apache.spark.sql.delta.ConcurrentDeleteReadException#ConcurrentDeleteReadException
を生じる。
もしくは、同じファイルを複数回消そうとしている場合、
org/apache/spark/sql/delta/OptimisticTransaction.scala:536
1 | val txnDeletes = actions.collect { case r: RemoveFile => r }.map(_.path).toSet |
例外
org.apache.spark.sql.delta.ConcurrentDeleteDeleteException#ConcurrentDeleteDeleteException
が生じる。
その他、何らかトランザクション上重複した場合…
1 | val txnOverlap = txns.map(_.appId).toSet intersect readTxn.toSet |
例外
org.apache.spark.sql.delta.ConcurrentTransactionException#ConcurrentTransactionException
が生じる。
以上に引っかからなかった場合は、例外を生じない。 トランザクション開始後、すべてのバージョンについて競合チェックが行われた後、 問題ない場合は、
org/apache/spark/sql/delta/OptimisticTransaction.scala:549
1 | logInfo(s"No logical conflicts with deltas [$checkVersion, $nextAttemptVersion), retrying.") |
org.apache.spark.sql.delta.OptimisticTransactionImpl#doCommit
メソッドが再実行される。 つまり、リトライである。
こうなるケースは何かというと、コンパクションを行った際、他のトランザクションで削除などが行われなかったケースなどだと想像。
sbtでテストコードを使って確認
上記実装の内容を確認するため、SBTのコンフィグを以下のように修正し、デバッガをアタッチして確認する。
1 | diff --git a/build.sbt b/build.sbt |
sbtを実行
1 | ./build/sbt |
sbtで以下のテストを実行する。
1 | > testOnly org.apache.spark.sql.delta.OptimisticTransactionSuite -- -z "block concurrent commit on full table scan" |
テストの内容は以下の通り。 tx1でスキャンしようとしたとき、別のtx2で先に削除が行われたケース。
1 | test("block concurrent commit on full table scan") { |
したがって、ここでは removedFiles
に値が含まれることになる。
1 | removedFiles = {ArrayBuffer@12893} "ArrayBuffer" size = 1 |
またtx2のアクションは正確には追加と削除であるから、
winningCommitActions の内容は以下の通りとなる。
1 | winningCommitActions = {ArrayBuffer@12887} "ArrayBuffer" size = 3 |
なお、今回は既存ファイルへの変更になるため、Blind Appendではない。
結果として、 changedDataAddedFiles
には以下のような値が含まれることになる。
1 | changedDataAddedFiles = {ArrayBuffer@15736} "ArrayBuffer" size = 1 |
addedFilesToCheckForConflicts も同様。
addedFilesToCheckForConflicts には以下の通り、
AddFile インスンタスが含まれる。
つまりtx2で追加しているファイルの情報が含まれる。
1 | addedFilesToCheckForConflicts = {ArrayBuffer@15866} "ArrayBuffer" size = 1 |
predicatesMatchingAddedFiles
は以下の通り、ファイル追加に関係するパーティション情報が含まれる。
1 | predicatesMatchingAddedFiles = {String[1]@15911} |
このことから、
org/apache/spark/sql/delta/OptimisticTransaction.scala:509
1 | if (predicatesMatchingAddedFiles.nonEmpty) { |
がfalseになり、例外
org.apache.spark.sql.delta.ConcurrentAppendException#ConcurrentAppendException
が生じることになる。 つまり、以下の箇所。
org/apache/spark/sql/delta/OptimisticTransaction.scala:509
1 | if (predicatesMatchingAddedFiles.nonEmpty) { |
コンパクション
公式ドキュメントのCompact filesの説明 にある通り、Delta Lakeで細かくデータを書き込むとファイルがたくさんできる。 これは性能に悪影響を及ぼす。 そこで、コンパクション(まとめこみ)を行うことがベストプラクティスとして紹介されている…。
なお、コンパクションでは古いファイルは消されないので、バキュームすることってことも書かれている。
バキューム
公式ドキュメントのVacuum に記載の通り、Deltaテーブルから参照されていないファイルを削除する。 リテンション時間はデフォルト7日間。
io.delta.tables.DeltaTable#vacuum メソッドの実態は、
io/delta/tables/DeltaTable.scala:90
1 | def vacuum(retentionHours: Double): DataFrame = { |
の通り、
io.delta.tables.execution.DeltaTableOperations#executeVacuum
メソッドである。
io/delta/tables/execution/DeltaTableOperations.scala:106
1 | protected def executeVacuum( |
なお、
org.apache.spark.sql.delta.commands.VacuumCommand#gc
メソッドの内容は意外と複雑。
というのも、バキューム対象となるのは、「Deltaテーブルで参照されて
いない ファイル」となるので、
すべてのファイル(やディレクトリ、そしてディレクトリ内のファイルも)をリストアップし、
その後消してはいけないファイルを除外できるようにして消すようになっている。
読まれているファイルの削除
公式ドキュメントのVacuum の中で、警告が書かれている。
We do not recommend that you set a retention interval shorter than 7 days, because old snapshots and uncommitted files can still be in use by concurrent readers or writers to the table. If VACUUM cleans up active files, concurrent readers can fail or, worse, tables can be corrupted when VACUUM deletes files that have not yet been committed.
これは、バキューム対象から外す期間(リテンション時間)を不用意に短くしすぎると、 バキューム対象となったファイルを何かしらのトランザクションが読み込んでいる可能性があるからだ、という主旨の内容である。
実装から見ても、
org.apache.spark.sql.delta.actions.FileAction
トレートに基づくフィルタリングはあるが、 当該トレートの子クラスは
- AddFile
- RemoveFile
であり、読み込みは含まれない。 そのため、仕様上、何らかのトランザクションが読み込んでいるファイルを消すことがあり得る、ということと考えられる。 ★要確認
なお、うっかりミスを防止するためのチェック機能はあり、
org.apache.spark.sql.delta.commands.VacuumCommand#checkRetentionPeriodSafety
メソッドがその実態である。
このメソッド内では、DeltaLogごとに定義されている
org.apache.spark.sql.delta.DeltaLog#tombstoneRetentionMillis
で指定されるよりも、短い期間をリテンション時間として
指定しているかどうかを確認し、警告を出すようになっている。
つまり、
1 | deltaTable.vacuum(100) // vacuum files not required by versions more than 100 hours old |
のようにリテンション時間を指定しながらバキュームを実行する際に、DeltaLog自身が保持している
tombstoneRetentionMillis よりも短い期間を閾値として
バキュームを実行しようとすると警告が生じる。なお、このチェックをオフにすることもできる。
コンフィグ
org.apache.spark.sql.delta.DeltaConfigs あたりにDelta
Lakeのコンフィグと説明がある。
例えば、
org.apache.spark.sql.delta.DeltaConfigs$#LOG_RETENTION
であれば、 org.apache.spark.sql.delta.MetadataCleanup
トレート内で利用されている。
ログのクリーンアップ
コンフィグ にてリテンションを決めるパラメータを例として上げた。 具体的には、以下のように、ログのリテンション時間を決めるパラメータとして利用されている。
org/apache/spark/sql/delta/MetadataCleanup.scala:38
1 | def deltaRetentionMillis: Long = { |
上記の
org.apache.spark.sql.delta.MetadataCleanup#deltaRetentionMillis
メソッドは、
org.apache.spark.sql.delta.MetadataCleanup#cleanUpExpiredLogs
メソッド内で利用される。
このメソッドは古くなったデルタログやチェックポイントを削除する。
このメソッド自体は単純で、以下のような実装である。
org/apache/spark/sql/delta/MetadataCleanup.scala:50
1 | private[delta] def cleanUpExpiredLogs(): Unit = { |
ポイントはいくつかある。
org.apache.spark.sql.delta.MetadataCleanup#listExpiredDeltaLogsメソッドは、チェックポイントファイル、デルタファイルの両方について、 期限切れになっているファイルを返すイテレータを戻す。- 上記イテレータに対し、mapとforeachでループさせ、ファイルを消す(
fs.delete(path, false)) - 最終的に消された件数をログに書き出す
なお、このクリーンアップは、チェックポイントのタイミングで実施される。
org/apache/spark/sql/delta/Checkpoints.scala:119
1 | def checkpoint(): Unit = recordDeltaOperation(this, "delta.checkpoint") { |
チェックポイントが実行されるのは、別途 チェックポイントを調査してみる で説明したとおり、 トランザクションがコミットされるタイミングなどである。(正確にはコミット後の処理postCommit処理の中で行われる)
ParquetからDeltaテーブルへの変換
スキーマ指定する方法としない方法がある。
1 | import io.delta.tables._ |
スキーマを指定しないAPIは以下の通り。
io/delta/tables/DeltaTable.scala:599
1 | def convertToDelta( |
上記の通り、実態は
io.delta.tables.execution.DeltaConvertBase#executeConvert
メソッドであり、 その中で用いられている
org.apache.spark.sql.delta.commands.ConvertToDeltaCommandBase#run
メソッドである。
io/delta/tables/execution/DeltaConvert.scala:26
1 | trait DeltaConvertBase { |
また、上記 run メソッド内の実態は
org.apache.spark.sql.delta.commands.ConvertToDeltaCommandBase#performConvert
メソッドである。
org/apache/spark/sql/delta/commands/ConvertToDeltaCommand.scala:76
1 | override def run(spark: SparkSession): Seq[Row] = { |
run メソッド内の performConvert
メソッドを利用し、実際に元データからDelta Lakeのデータ構造を作りつつ、
その後の
io.delta.tables.DeltaTable$#forPath(org.apache.spark.sql.SparkSession, java.lang.String)
メソッドを呼び出すことで、
データが正しく出力されたことを確認している。
1 | DeltaTable.forPath(spark, tableIdentifier.table) |
もし出力された内容に何か問題あるようであれば、 forPath
メソッドの途中で例外が生じるはず。
ただ、この仕組みだと変換自体は、たとえ失敗したとしても動いてしまう(アトミックな動作ではない)ところが気になった。
★気になった点
動作確認
まずは、サンプルとしてSparkに含まれているParquetファイルを読み込む。
1 | scala> val originDFPath = "/opt/spark/default/examples/src/main/resources/users.parquet" |
では、このParquetファイルを変換する。
io.delta.tables.DeltaTable#convertToDelta
メソッドの引数で与えるPATHは、
Parqeutテーブルを含む「ディレクトリ」を期待するので、最初にParquetファイルを
適当なディレクトリにコピーしておく。
1 | mkdir /tmp/origin |
上記ディレクトリを指定して、変換する。
1 | scala> import io.delta.tables._ |
ディレクトリ以下は以下のようになった。
1 | dobachi@thk:/mnt/c/Users/dobachi/Sources.win/memo-blog-text$ ls -R /tmp/origin/ |
なお、メタデータは以下の通り。
1 | $ cat /tmp/origin/_delta_log/00000000000000000000.json | jq |
Symlink Format Manifest
Presto and Athena to Delta Lake Integration によると、Presto等で利用可能なマニフェストを出力できる。
ここでは予め /tmp/delta-table に作成しておいたDelta
Tableを読み込み、マニフェストを出力する。
1 | scala> import io.delta.tables._ |
以下のようなディレクトリ、ファイルが出力される。
1 | ls -1 |
_delta_log および part-000...
というディレクトリ、ファイルはもともとDelta Lakeとして
存在していたものである。 これに対し、
_symlink_format_manifest- Deltaテーブルが含むファイル群を示すマニフェストを含むディレクトリ
derby.log- HiveメタストアDBのログ(Derbyのログ)
metastore_db- Hiveメタストア
が出力されたと言える。 マニフェストの内容は以下の通り。
1 | cat _symlink_format_manifest/manifest |
上記の例では、パーティション化されていないDeltaテーブルを扱った。 この場合、マニフェストは1個である。 アトミックな書き込みが可能。 Snapshot consistency が実現できる。
一方、 Presto Athena連係の制約 によるとパーティション化されている場合、マニフェストもパーティション化される。 そのため、全パーティションを通じて一貫性を保つことができない。(部分的な更新が生じうる)
それでは、実装を確認する。
エントリポイントは、公式ドキュメントの例にも載っている
io.delta.tables.DeltaTable#generate メソッド。
io/delta/tables/DeltaTable.scala:151
1 | def generate(mode: String): Unit = { |
これの定義を辿っていくと、
org.apache.spark.sql.delta.commands.DeltaGenerateCommand#run
メソッドにたどり着く。
org/apache/spark/sql/delta/commands/DeltaGenerateCommand.scala:48
1 | override def run(sparkSession: SparkSession): Seq[Row] = { |
上記の通り、Delta LakeのディレクトリからDeltaLogを再現し、
それを引数としてマニフェストを生成するメソッドを呼び出す。
変数にバインドするなどしているが、実態は
org.apache.spark.sql.delta.hooks.GenerateSymlinkManifestImpl#generateFullManifest
メソッドである。
org/apache/spark/sql/delta/commands/DeltaGenerateCommand.scala:63
1 | object DeltaGenerateCommand { |
そこで当該メソッドの内容を軽く確認する。
org/apache/spark/sql/delta/hooks/GenerateSymlinkManifest.scala:154
1 | def generateFullManifest( |
ポイントは、
org.apache.spark.sql.delta.hooks.GenerateSymlinkManifestImpl#writeManifestFiles
メソッドである。 これが実際にマニフェストを書き出すメソッド。
類似技術
- Apache Hudi
- https://hudi.apache.org/
- Ice
- https://iceberg.apache.org/