Belajar ChromaDB (vector database untuk RAG) dari dasar hingga production-grade: pre-requisites & setup environment, sejarah & latar belakang, konsep dasar & arsitektur utama, setup client & collection pertama, CRUD dasar, querying & semantic search, embeddings & embedding functions, metadata filtering where, full-text & hybrid search, distance metrics & HNSW index, data modeling & chunking strategy, persistence import & export, client-server mode & settings, authentication & authorization, security best practices & CVE-2026-45829, deployment networking, privacy & data handling, scaling & performance, integrasi dengan framework LLM, advanced query patterns, observability & operations, fitur modern & roadmap, hingga ekosistem alternatif & refleksi akhir dengan total 23 episode.
Sebelum menyentuh ChromaDB, kalian perlu menguasai Python, konsep embedding dan vektor, serta alur RAG secara umum. Di episode ini kalian juga menyiapkan environment Python, menginstall chromadb, dan memverifikasi instalasi pertama.

Episode ini mengupas sejarah dan latar belakang lahirnya ChromaDB, evolusinya dari versi 0.x ke 1.x dengan server Rust, serta masalah nyata yang diselesaikannya: penyimpanan embedding skala jutaan, semantic search, dan integrasi cepat dengan framework LLM.

Episode ini membedah model data ChromaDB: Collection yang terdiri dari ids, embeddings, documents, dan metadatas, perbedaan embedded mode versus client-server, arsitektur server Python FastAPI lawas versus server Rust, serta alur index dan query berbasis HNSW.

Episode ini membahas berbagai jenis klien ChromaDB: Client, PersistentClient, EphemeralClient, dan HttpClient, beserta cara membuat dan mengambil collection dengan nama, metadata, dan parameter embedding function yang tepat.

Episode ini membahas seluruh operasi manipulasi data di ChromaDB: add, get, update, upsert, delete, count, dan modify, beserta kombinasi ids, documents, metadatas, dan embeddings yang bisa disimpan sekaligus dalam satu panggilan.

Episode ini membedah API query ChromaDB: query_texts dan query_embeddings, pengaturan n_results, serta parameter include untuk memilih dokumen, metadatas, distances, atau embeddings yang dikembalikan, lengkap dengan interpretasi distance vs similarity.

Episode ini membahas embeddings dan embedding functions di ChromaDB: model bawaan ONNX MiniLM yang berjalan lokal tanpa API key, penggantian ke sentence-transformers atau OpenAI, penggunaan pre-computed embeddings, dan penulisan fungsi embedding custom.

Episode ini membahas metadata filtering dengan klausa where: operator $eq, $ne, $in, $nin, $gt, $lt, $gte, dan $lte, metadata bersarang, logika $and dan $or, serta pencarian dokumen lewat $contains, $not_contains, dan regex.

Episode ini membahas full-text search untuk pencarian keyword yang presisi, skor relevansi, lalu strategi hybrid search yang menggabungkan vector, full-text, dan metadata, termasuk pendekatan fusion dan rerank untuk retrieval RAG yang akurat.

Episode ini membahas distance functions L2, cosine, dan inner product serta kapan memakai masing-masing sesuai model embedding, lalu mendalami tuning index HNSW: parameter ef_construction, M, dan ef search beserta trade-off recall, latensi, dan memori.
