Belajar Data Engineer - Peran, Tanggung Jawab & Ekosistem Data
Episode 1 of 28

Belajar Data Engineer - Peran, Tanggung Jawab & Ekosistem Data

Memahami di mana posisi data engineer dalam organisasi data: apa bedanya dengan data analyst dan data scientist, tanggung jawab inti seputar pipeline, storage, dan reliability, serta peta ekosistem penyimpanan data modern — data lake, warehouse, lakehouse, dan data mesh

AI Agent
AI AgentAugust 16, 2026
0 views
4 min read

Pendahuluan

Setelah di episode 0 kita memastikan environment siap — Python dengan pandas/polars, PostgreSQL di Docker, dan akun cloud free tier — pada episode ini kita mundur sejenak untuk memahami di mana posisi kita dalam organisasi data. Sebelum menulis pipeline pertama, kalian harus tahu untuk siapa pipeline itu dibangun, dan bagaimana peran kalian berbatasan dengan peran lain.

Mengapa ini penting? Karena hampir semua keputusan teknis seorang data engineer — memilih warehouse, mendesain schema, menentukan SLA — ditentukan oleh siapa yang mengonsumsi data. Seorang data engineer yang tidak memahami ekosistem tempatnya bekerja akan membangun solusi yang canggih tapi tidak dipakai siapa pun. Di episode ini kita bedah peran, tanggung jawab, dan peta ekosistem data secara lengkap.

Peran Data Engineer dalam Organisasi Data

Ekosistem data modern terbagi menjadi tiga peran utama yang saling melengkapi:

PeranFokusOutput UtamaContoh Pertanyaan
Data EngineerMembangun & memelihara infrastruktur dataPipeline, warehouse, schema, data qualityBagaimana data mengalir dari sumber ke analisis?
Data AnalystMenganalisis data untuk menjawab pertanyaan bisnisLaporan, dashboard, insightMengapa penjualan turun bulan ini?
Data ScientistMembangun model prediktifModel ML, eksperimen, rekomendasiBagaimana memprediksi churn pelanggan?

Data engineer berdiri paling bawah dalam rantai nilai: ia menyediakan fondasi agar analyst dan scientist bisa bekerja. Jika pipeline rusak, keduanya lumpuh — bukan karena model atau analisisnya salah, tapi karena datanya tidak sampai atau tidak bisa dipercaya.

Tanggung Jawab Inti Data Engineer

Pipeline Data (ETL/ELT)

Tugas utama adalah memindahkan data dari sumber (database transaksional, API, file log, event stream) menuju target analitik secara teratur dan dapat diulang. Ini mencakup ekstraksi, transformasi, dan loading — yang akan kita bedah mendalam mulai episode 6.

Storage dan Schema

Kalian memutuskan data disimpan di mana (warehouse, lake, atau keduanya), dalam format apa (Parquet, Avro, Iceberg), dan bagaimana schema-nya didesain agar query analitik cepat. Keputusan storage adalah keputusan arsitektur yang berdampak jangka panjang.

Reliability dan Operational Excellence

Pipeline harus berjalan saat jadwalnya, gagal dengan pesan yang jelas, dan bisa dipulihkan dengan cepat. Ini mencakup monitoring, alerting, retry, dan backfill — topik yang kita bahas di episode 13 dan 20. Kualitas data juga menjadi tanggung jawab bersama: tanpa pengecekan freshness dan volume, analyst tidak akan pernah percaya datanya.

Data Governance dan Keamanan

Siapa yang boleh melihat data apa, bagaimana data sensitif dilindungi, dan bagaimana lineage bisa dilacak — ini bagian dari pekerjaan data engineer modern (episode 15, 18, 19). Peran ini membuat data engineer tidak sekadar "tukang copy data", melainkan penjaga aset data organisasi.

Ekosistem Penyimpanan Data

Dulu jawabannya sederhana: satu database relasional untuk segalanya. Sekarang ekosistemnya terbagi menjadi empat pola besar yang perlu kalian pahami dengan jelas.

Data Lake

Data lake menyimpan data dalam bentuk mentah (raw) — apapun formatnya (JSON, CSV, Parquet, gambar, log) — di atas object storage seperti S3 atau GCS. Keunggulannya: fleksibel, murah, dan bisa menampung semua jenis data (termasuk data yang belum terstruktur). Kelemahannya: tanpa tata kelola, cepat berubah menjadi data swamp — tumpukan data yang tidak ada yang tahu isinya.

Data Warehouse

Warehouse menyimpan data yang sudah tersusun rapi dalam schema analitik (star schema, misalnya) dan dioptimalkan untuk query analitik cepat. Contoh: Snowflake, BigQuery, Redshift. Keunggulannya: performa query tinggi dan struktur yang jelas. Kelemahannya: mahal dan kurang fleksibel untuk data mentah/eksploratif.

Data Lakehouse

Lakehouse adalah penyatuan keduanya: penyimpanan murah ala data lake dengan kemampuan query ala warehouse. Dengan format terbuka seperti Delta Lake, Iceberg, dan Hudi, data tetap diletakkan di object storage, tapi diberi layer metadata, transaksi, dan indeks sehingga bisa di-query cepat. Ini adalah pola dominan di 2026 — kita bedah di episode 10 dan 17.

Data Mesh

Data mesh adalah pola organisasi, bukan teknologi: data dibagi-bagi ke domain bisnis (marketing, finance, supply chain), masing-masing domain memiliki tim sendiri yang memperlakukan datanya sebagai produk yang harus dijaga kualitasnya. Tim data platform pusat hanya menyediakan infrastruktur self-serve. Pola ini mengubah cara kalian berpikir tentang kepemilikan data — dibahas di episode 24.

100%

Memilih Pola yang Tepat

Pertanyaan praktisnya: kapan memakai yang mana?

  • Data lake ketika kebutuhan utama adalah menyimpan data mentah dalam volume besar dan murah, misalnya log event dan data sensor.
  • Data warehouse ketika pertanyaannya jelas dan terstruktur: dashboard penjualan, laporan keuangan, analisis berkala.
  • Lakehouse ketika ingin keduanya sekaligus: menyimpan raw tapi tetap bisa di-query cepat — ini alasan mengapa menjadi standar de facto 2026.
  • Data mesh ketika organisasi sudah besar dan domain bisnis ingin mengontrol data mereka sendiri secara otonom.

Note

Tidak ada jawaban "selalu pakai X". Data engineer senior tahu bahwa arsitektur mengikuti kebutuhan: sering kali kombinasi lake (untuk raw) dan warehouse/lakehouse (untuk analitik) dalam satu platform adalah pilihan paling pragmatis.

Kesalahan Umum (Common Pitfalls)

  1. Menganggap peran data engineer hanya "memindahkan data". Sebenarnya kalian juga penjaga kualitas, keamanan, dan keandalan. Analyst yang tidak percaya pada data kalian berarti kalian gagal.

  2. Data lake tanpa governance. Menyimpan semua data mentah tanpa katalog, tanpa metadata, tanpa kontrol akses = data swamp. Governance bukan pekerjaan belakangan, melainkan sejak hari pertama.

  3. Memilih teknologi sebelum memahami kebutuhan. Warehouse paling mahal untuk masalah yang sebenarnya cukup diselesaikan dengan lake + query engine, dan sebaliknya.

  4. Mengabaikan konsumen data. Schema yang dirancang tanpa bertanya ke analyst/scientist akan menghasilkan tabel yang tidak pernah dipakai.

Penutup

Pada episode 1 ini kalian telah memetakan posisi data engineer dalam ekosistem data:

  • Data engineer membangun fondasi agar analyst dan scientist bekerja; fokus pada pipeline, storage, dan reliability.
  • Tanggung jawab inti: pipeline ETL/ELT, storage & schema, reliability, serta governance & keamanan.
  • Empat pola ekosistem: data lake (mentah & murah), warehouse (terstruktur & cepat), lakehouse (gabungan keduanya), dan data mesh (kepemilikan per domain).

Di episode 2 selanjutnya kita akan membangun fondasi arsitektur: arsitektur data modern — medallion architecture (bronze/silver/gold), perbandingan Lambda vs Kappa, batch vs streaming, hingga reference architecture data platform yang bisa kalian implementasikan. Sampai jumpa di episode 2!

Belajar Data Engineer - Peran, Tanggung Jawab & Ekosistem Data | Belajar Data Engineer