テクノロジー

Aurora PostgreSQLからデータレイクを直接分析、DuckDB統合でETLを省力化

AWSはAurora PostgreSQLにDuckDBを統合し、データレイク上のParquetやIceberg形式のデータを直接読み取れるようにしたと発表しました。

編集部
Aurora PostgreSQLからデータレイクを直接分析、DuckDB統合でETLを省力化

AWSは、Amazon Aurora PostgreSQLにDuckDBを統合し、データレイクに保存されたデータを直接読み取って処理できるようにしたと発表しました。データを事前にデータベースへコピーするETL処理を減らし、ライブデータと過去データを組み合わせた分析を行いやすくする狙いです。

何が変わる?

今回の統合では、Aurora PostgreSQLからDuckDBを利用し、Amazon S3などに保存されたParquetやApache Iceberg形式のデータを読み取れます。従来はデータレイクの情報をPostgreSQLで使うために、データのコピーや変換、同期の仕組みが必要になる場合がありました。発表内容によると、データを移動せずにクエリできるため、そうした事前処理の手間を抑えられます。

DuckDBは、分析処理に適した小型のOLAPエンジンです。カラム型で並列処理に対応し、Parquetをはじめとする形式のデータを扱えます。今回の統合によって、データベース内の最新情報と、データレイクに蓄積した履歴情報を一つのクエリで参照できる点が特徴です。

利用時に確認したい点

ETLが不要になるという説明は、データレイク上のデータを直接参照する今回の仕組みに関するものです。具体的な利用条件や対応リージョン、料金、性能の詳細は、資料では確認できません。導入を検討する場合は、AWSの公式情報で提供条件を確認する必要があります。

AWSは、アプリに組み込まれるAIエージェントが必要なデータをその場で照会できることも利点として挙げています。ただし、実際の効果はデータ構成やクエリ、運用環境によって異なります。

出典

Publickeyの記事

AWSAmazon Aurora PostgreSQLDuckDBデータレイクETL

出典