Amazon Web Services ブログ

Category: Analytics

Amazon MWAA Serverless で PythonOperator と BashOperator が利用可能に

Amazon MWAA Serverless で PythonOperator と BashOperator が使えるようになり、カスタムの Python 関数やシェルスクリプトをサーバーレスランタイム上で直接実行できます。AWS Lambda 関数や Amazon ECS タスクでコードをラップする必要はありません。本記事では、コードバンドルの仕組みと実行モデルを解説し、PythonOperator で CSV を JSON に変換し BashOperator で出力を検証するパイプラインを AWS CLI で構築します。

Amazon MWAA と Airflow 3.0 によるイベント駆動のパイプラインオーケストレーション

Apache Airflow 3.0 の Asset Watcher と Amazon SQS を組み合わせて、複数の Amazon MWAA 環境や AWS アカウントをまたぐイベント駆動のオーケストレーションを実現する方法を解説します。ポーリングベースのセンサーをイベント駆動のトリガーに置き換えることで、環境間オーケストレーションのレイテンシーを数分から数秒に短縮できます。クロスアカウント IAM、triggerer の健全性、Amazon VPC のネットワーク、DAG 設計のベストプラクティスも紹介します。

Razor Group が AWS でモダンなデータレイクハウスを構築するまでの道のり

Razor Group は 250 以上のブランドを展開する欧州有数の EC アグリゲーターです。本記事では、同社が AWS 上に Apache Iceberg と Amazon S3 Tables を軸としたレイクハウスアーキテクチャを構築し、データプラットフォームを最適化した道のりを紹介します。段階的な移行アプローチ、アーキテクチャ上の意思決定、そしてインフラコスト 63% 削減やクエリ 65% 高速化といった測定可能な成果を取り上げます。

AWS Glue を使用して DynamoDB テーブルエクスポートをフィルタリング、変換、ロードする

この記事では、Amazon DynamoDB のフルまたはインクリメンタルテーブルエクスポートを 2 つ目の DynamoDB テーブルにロード(インポート)する方法を紹介します。何をロードするか、どの書き込みレートでロードするかを正確にコントロールでき、進捗を観察する機能も備えています。この技術は、最大限の制御が必要な大規模なデータマイグレーションや同期を推進するのに役立ちます。ここで説明するメカニズムは、オープンソースの Bulk Executor for DynamoDB のコマンドとして提供されています。これは、DynamoDB テーブルに対してバルクコマンドを実行するためのユーティリティセットです。このコマンドを使用することで、DynamoDB のエクスポート(済みデータ)を細かく制御しながらロードでき、アイテムを変換したり、データをフィルタリングしたり、コマンドのオプションの transform パラメータを使用して宛先テーブルに何を配置するかをカスタマイズしたりできます。

DuckDB で Amazon S3 Tables に格納された表形式データセットへのアクセスを効率化する

DuckDB は軽量なインメモリ SQL エンジンで、追加のサーバー運用なしに対話型のデータ分析を実現します。本記事では、Amazon SageMaker Lakehouse Iceberg REST エンドポイントと AWS Lake Formation のアクセス許可を利用して、AWS CloudShell 上の DuckDB から Amazon S3 Tables に格納された Iceberg テーブルにアクセスし、クエリを実行する手順を紹介します。

Amazon SageMaker Unified Studio のノートブックで、より速くインサイトに到達する

Amazon SageMaker Unified Studio のノートブックは、インフラ設定を簡素化し、インサイト獲得までの時間を短縮します。本記事では、Python と SQL のポリグロットプログラミング、複数エンジンでのデータアクセス、Athena Spark による分散プロファイリング、SageMaker Data Agent の AI 支援を活用し、単一のノートブック環境で住宅価格予測モデルを構築する流れを解説します。