Belajar Machine Learning dari nol hingga production-grade: pre-requisites skill & setup environment, definisi & jenis-jenis ML, pipeline ML & tooling, matematika dasar untuk ML, EDA & data preprocessing, supervised regression & classification, tree-based models & ensemble, unsupervised clustering & dimensionality reduction, feature engineering & selection, model evaluation & hyperparameter tuning, experiment tracking & reproducibility, time series forecasting, NLP & text data dasar, imbalanced data & anomaly detection, categorical data & encoding lanjutan, model security & adversarial ML, ML pipelines & automation (MLOps), deployment & serving model, gradient boosting lanjutan, model interpretation (XAI), reinforcement learning, scale big data & AutoML, ekosistem & tren modern 2026, hingga roadmap karir & refleksi akhir dengan total 25 episode.
Sebelum menyentuh model ML, kalian perlu menguasai dasar Python, NumPy & Pandas, serta pemahaman data tabular. Di episode ini kalian juga menyiapkan Python 3.12+, Jupyter/VS Code, venv, dan library inti (NumPy, Pandas, Matplotlib, scikit-learn 1.8.x), lalu memverifikasi seluruh environment siap dipakai sepanjang series.

Memahami definisi formal Machine Learning menurut Arthur Samuel dan Tom Mitchell, posisinya dalam payung AI, serta empat pendekatan utama: supervised, unsupervised, semi-supervised, dan reinforcement learning, lengkap dengan contoh masalah nyata dan cara memilihnya.

Mengurai alur lengkap pipeline machine learning dari data mentah hingga deployment, memahami pembagian train/validation/test yang benar, API konsisten scikit-learn (fit, predict, transform), serta pentingnya reproducibility lewat random seed dan environment yang terkontrol.

Memahami tiga pilar matematika di balik machine learning: aljabar linear (vektor, matriks, dot product), kalkulus intuitif (turunan dan gradient descent), serta probabilitas dan statistik (distribusi, mean/variance, korelasi) lengkap dengan implementasi NumPy.

Mempelajari exploratory data analysis untuk memahami distribusi, outlier, dan missing values, lalu preprocessing yang benar: scaling dengan StandardScaler/MinMaxScaler, encoding One-Hot/Label, serta train/test split tanpa data leakage berbasis scikit-learn Pipeline.

Menguasai supervised learning jenis regression: linear dan polynomial regression, regularisasi dengan Ridge/Lasso/ElasticNet untuk melawan overfitting, serta evaluasi dengan MSE, MAE, dan R2 melalui studi kasus prediksi harga rumah menggunakan scikit-learn.

Menguasai classification dengan logistic regression dan k-Nearest Neighbors, evaluasi menyeluruh via accuracy, precision/recall, F1, confusion matrix, dan ROC-AUC, plus penanganan data tidak seimbang memakai class_weight dan SMOTE pada studi kasus prediksi churn.

Memahami cara kerja decision tree dengan split berbasis Gini/entropy, konsep bias-variance dan overfitting, lalu naik ke ensemble: Random Forest untuk bagging serta XGBoost, LightGBM, dan CatBoost sebagai gradient boosting yang menjadi workhorse data tabular 2026.

Memasuki unsupervised learning: clustering dengan k-Means, DBSCAN, dan hierarchical beserta evaluasi silhouette, lalu dimensionality reduction memakai PCA untuk reduksi fitur serta t-SNE dan UMAP untuk visualisasi data berdimensi tinggi.

Mengubah data mentah menjadi fitur yang benar-benar berguna: fitur turunan, binning, interaksi, dan penanganan tanggal/kategori, lalu memilih fitur terbaik dengan metode filter (korelasi), wrapper, dan embedded (feature_importances) serta mengelola multicollinearity.
