Data Science & AI Sheet
The Data Science and AI sheet spans classical machine learning and modern applied AI: statistics and experiment design, model evaluation, embeddings and retrieval, transformer architecture, fine-tuning, agents and the system design of GenAI products.
The sheet holds 25 patterns and 137 topics, tracked row by row. From any row you can read the theory for a topic, sit a mock interview on it, have the AI coach teach it back to you, keep notes, bookmark a row and mark it done. Progress is saved against your account, so the sheet is also the record of what you have already covered.
Who it is for
It is for data scientists, machine-learning engineers and applied-AI engineers preparing for interviews that mix statistics, modelling and system design in one loop.
How to work through it
Treat every topic as a question you must answer out loud with a worked example. Interviews in this area reward someone who can state an assumption, name what breaks it, and say what they would measure instead.
Practice runs on the same platform as the sheet: 850+ problems across every track, code execution in 6 languages, and AI mock interviews that follow the pattern you are studying rather than a random question.
What the data science & ai sheet covers
Data Science
12 patterns covering statistics, ML, and data analysis
- Data Manipulation & Preprocessing — Time Series Data Handling, Feature Engineering, Data Aggregation & Grouping, Data Cleaning & Missing Values, Outlier Detection & Treatment, Data Transformation & Scaling
- Supervised Learning - Classification — Classification Evaluation Metrics, Binary Classification, Ensemble Methods for Classification, Tree-based Classification, Multi-class Classification, SVM & Kernel Methods
- Statistics & Probability Fundamentals — Descriptive Statistics, Confidence Intervals, A/B Testing, Bayesian Statistics, Probability Distributions, Hypothesis Testing
- Time Series Analysis — Trend & Seasonality Analysis, ARIMA Models, Advanced Time Series Models, Time Series Cross-validation, Time Series Components, Forecasting Techniques
- Deep Learning Fundamentals — Convolutional Neural Networks, Recurrent Neural Networks, Transfer Learning, Neural Network Basics, Backpropagation & Optimization, Deep Learning for Tabular Data
- Supervised Learning - Regression — Ensemble Methods for Regression, Linear Regression, Polynomial & Ridge Regression, Logistic Regression, Regression Evaluation Metrics, Tree-based Regression
- Business Analytics & Metrics — Customer Segmentation, Business KPI Analysis, Marketing Analytics, Recommendation Systems, Price Optimization, Churn Prediction
- Unsupervised Learning — Association Rules & Market Basket Analysis, Hierarchical Clustering, Anomaly Detection, Principal Component Analysis (PCA), K-Means Clustering, DBSCAN & Density-based Clustering
- Model Selection & Validation — Cross-validation Techniques, Train-Validation-Test Split, Bias-Variance Tradeoff, Hyperparameter Tuning, Overfitting & Underfitting, Model Comparison
- Natural Language Processing — Sentiment Analysis, Word Embeddings, Bag of Words & TF-IDF, Text Preprocessing, Named Entity Recognition, Topic Modeling
- Feature Selection & Dimensionality Reduction — t-SNE & UMAP, PCA & SVD, Wrapper Methods, Feature Importance Analysis, Embedded Methods, Filter Methods
- Exploratory Data Analysis (EDA) — Pattern Recognition in Data, Correlation Analysis, Data Visualization Techniques, Bivariate Analysis, Distribution Analysis, Univariate Analysis
AI & Machine Learning
13 patterns covering neural networks, LLMs, and AI systems
- Neural Network Fundamentals — MLP Architecture and Training, Regularization Techniques, Optimization Algorithms, Activation and Loss Functions, Weight Initialization and Normalization
- Retrieval-Augmented Generation — Embedding Generation, Context Injection Methods, RAG Evaluation Techniques, Document Chunking Strategies, Vector Store Integration
- Multimodal Transformers — Image-Text Modeling, Audio-Text Modeling, Cross-Modal Representations, Vision Transformer Architecture, Multimodal Applications
- Agents and Tool Use — Function Calling Mechanisms, Agent Reasoning and Planning, Multi-Step Execution, Memory-Augmented Agents, Agent Evaluation and Control
- GenAI System Design — Multi-Model Architecture Design, RAG Pipeline Integration, Monitoring and Logging Systems, Model Inference Optimization, Caching and Serving Infrastructure
- Safety, Bias, and Ethics — Bias and Fairness Auditing, Alignment and Ethical Frameworks, Prompt Injection Prevention, Adversarial and Red Team Testing, Guardrail and Filtering Strategies
- Transformer Architecture — Encoder-Decoder Architecture, Self-Attention Mechanism, Positional Encoding, Transformer Variants, Feedforward and Residual Connections
- Evaluation and Benchmarks — RAG-Specific Evaluation Methods, Reasoning and QA Evaluation, Human vs Automated Evaluation, Text Generation Metrics, Instruction Following Benchmarks
- Embeddings and Representation Learning — Contrastive Learning Techniques, Sentence and Document Representations, Similarity and Search Applications, Contextual Embeddings, Word and Token Embeddings
- Fine-Tuning and Adaptation — Full Model Fine-Tuning, Dataset Curation and Processing, Adapter and LoRA Methods, Evaluation of Adapted Models, Parameter-Efficient Fine-Tuning
- Sequence and Attention Models — Recurrent Architectures, Limitations of Sequential Models, Sequence-to-Sequence Modeling, Temporal Dependency Handling, Attention Mechanisms
- Large Language Models — Tokenization and Context Handling, Language Model Objectives, Reinforcement Learning Techniques, Instruction and Chat Tuning, Prompting and Conditioning
- Open Source Model Ecosystem — Quantization and Compression, Local Deployment Workflows, Transformer Inference Workflows, Model Merging and Distillation, Model Selection and Comparison