データエンジニアリング

データエンジニアリング

Dask on Ubuntu — Pandasの限界を超える並列データ処理の実践

本記事のコマンドはすべて docker run --rm ubuntu:24.04(2026-06-22 実測)で確認しています。VPS や WSL2 でも同じ手順で動作します。
データエンジニアリング

Logstash on Ubuntu — ログ収集パイプラインのフィルタ設定実践

サーバーのアクセスログやアプリログを、人間が読める形からデータベースで検索できる形に変換したい。そういった場面で使われるのが Logstash です。
データエンジニアリング

Metabase on Ubuntu — ノーコードBIツールのDockerセルフホスト

Metabase は、SQL が書けなくてもデータを可視化・集計できるオープンソースの BI ツールです。PostgreSQL や MySQL にブラウザから接続し、ドラッグ&ドロップでグラフを作れます。SaaS 版もありますが、Docke…
データエンジニアリング

Apache Superset on Ubuntu — BIダッシュボードをセルフホスト構築

BIツールをクラウドSaaSで使うと、データを外部サービスに送ることになります。社内データや個人プロジェクトのデータを扱う場合、自前のVPSや自宅サーバーで動かしたい、というのは自然な発想です。
データエンジニアリング

Apache Flink on Ubuntu — ストリーム処理エンジンの構築と入門

Apache Flink は、リアルタイムにデータを処理するストリーム処理エンジンです。Kafka や IoT センサーから流れ込むデータを、バッチではなく「届いた瞬間」に処理できるのが最大の特徴です。「ログが溜まってから夜中に集計する」で…
データエンジニアリング

Airbyte on Ubuntu — 646コネクタ対応のELTパイプライン自前構築

PostgreSQLのデータをBigQueryに流したい、Google AnalyticsのデータをS3に定期保存したい——こういったデータ移動の要件は、プロダクトが成長するにつれて必ず出てきます。
データエンジニアリング

TimescaleDB on Ubuntu — 時系列データ特化PostgreSQL拡張の構築

PostgreSQL は汎用 RDB として広く使われていますが、IoT センサーのログ・サーバーメトリクス・金融時系列のように「タイムスタンプ付きの大量データを速く書いて速く読む」用途では素の PostgreSQL では物足りなくなること…
データエンジニアリング

DuckDB on Ubuntu — ローカル分析用高速組み込みDBの使い方

DuckDBは、SQLiteのようにインストール不要で使える高速分析向けデータベースです。CSVやParquetファイルを直接SQLで查询でき、100万行の集計クエリも15msで処理します。本記事ではUbuntu 24.04 LTS(Doc…
データエンジニアリング

dbt on Ubuntu — データ変換ツールの導入とBigQuery/PostgreSQL連携

dbt(data build tool)は、SQL を書くだけでデータウェアハウス上の変換処理をバージョン管理できるツールです。BigQuery や PostgreSQL に直接クエリを投げる代わりに、dbt のモデルファイル(.sql)を…
データエンジニアリング

OpenSearch on Ubuntu — ElasticSearch代替OSSの構築と基本設定

Elasticsearch の代替として注目を集めている OpenSearch を、Ubuntu 24.04 LTS 環境に Docker で構築する手順を解説します。 本記事では opensearchproject/opensearch:…