Data Science Guides
Analyze, visualize, and model data using Python, R, and real-world datasets.
Filter: choose a letter below to show Data Science guides whose title starts with that letter, or select All to see everything.
-
A/B Testing with Small Traffic: Designing Experiments You Can Trust
A/B testing with small traffic (2026): define a meaningful minimum detectable effect, estimate statistical power and duration, choose the right randomization unit, use focused metrics and guardrails…
-
Data Analysis with Python: Basics (2025 Guide)
Data analysis with Python basics for 2025: pandas + NumPy essentials, loading CSV/Excel/SQL data, quick profiling and data quality checks, cleaning and typing, transformations, groupby and pivot…
-
Data Science for Beginners (2025): Concepts, Workflow, Tools & Learning Path
Data Science for beginners in 2025: what data science is, how it differs from analytics and machine learning, a step-by-step workflow, real-world examples, beginner-friendly tools (spreadsheets, SQL…
-
Explaining Model Predictions: SHAP vs Permutation Importance (When to Use What)
SHAP vs permutation importance explained (2026): learn the difference between local and global model explanations, how permutation importance measures performance dependence, how SHAP attributes…
-
Exploratory Data Analysis Checklist for Messy Real-World Datasets
Exploratory data analysis checklist for messy real-world datasets (2026): inspect schema and types, profile missing values, detect duplicates, validate ranges and categories, investigate outliers…
-
Feature Engineering for Tabular Data: Simple Techniques That Win Baselines
Feature engineering for tabular data (2026): build stronger machine-learning baselines with simple date features, log transforms, ratios, interactions, bins, missing indicators, categorical encoding…
-
From CSV to Dashboard: Building a Lightweight Analytics Pipeline
Build a lightweight analytics pipeline from CSV to dashboard (2026): validate incoming files, clean data with pandas, store efficient Parquet files, query with DuckDB, create reusable aggregates…
-
Handling Missing Data in Python: Practical Imputation Strategies
Handling missing data in Python (2026): diagnose why values are missing, choose deletion or imputation deliberately, use median and categorical strategies, add missingness indicators, apply…
-
How to Become a Data Scientist (2025 Roadmap): Skills, Portfolio, MLOps & Interviews
How to become a data scientist in 2025: a practical roadmap covering Python and SQL, analytics and experimentation, statistics that matter, machine learning fundamentals, model evaluation and…
-
Metrics That Mislead: Accuracy vs F1 vs ROC-AUC (With Use-Case Guidance)
Accuracy vs F1 vs ROC-AUC explained (2026): learn why classification metrics can mislead, how class imbalance changes interpretation, when precision or recall matters more, what ROC-AUC actually…
-
Preventing Data Leakage: Validation Splits and Common Traps Explained
Prevent data leakage in machine learning (2026): choose validation splits that match production, fit preprocessing only on training data, keep related entities and duplicates together, respect time…
-
Time Series Backtesting Basics: Seasonality, Drift, and Realistic Evaluation
Time series backtesting basics (2026): evaluate forecasts with realistic rolling-origin splits, expanding and sliding windows, correct forecast horizons, seasonal baselines, gaps, leakage-safe…