Library
- What Machine Learning Is, and Is Not001✓ EXPLORED
What Machine Learning Is, and Is Not
- The Data Is the Model002✓ EXPLORED
The Data Is the Model
- Features and Representations003✓ EXPLORED
Features and Representations
- Loss: How a Model Knows It Is Wrong004✓ EXPLORED
Loss: How a Model Knows It Is Wrong
- Gradient Descent005✓ EXPLORED
Gradient Descent
- Backpropagation006✓ EXPLORED
Backpropagation
- What a Neural Network Actually Computes007✓ EXPLORED
What a Neural Network Actually Computes
- Parameters, Weights, Layers, Activations008✓ EXPLORED
Parameters, Weights, Layers, Activations
- Activations: ReLU, GELU, SwiGLU009✓ EXPLORED
Activations: ReLU, GELU, SwiGLU
- Training Versus Inference010✓ EXPLORED
Training Versus Inference
- Self-Supervised Learning011✓ EXPLORED
Self-Supervised Learning
- Overfitting and Generalisation012✓ EXPLORED
Overfitting and Generalisation
- Residual Connections and Normalisation013✓ EXPLORED
Residual Connections and Normalisation
- Why Scale Worked014✓ EXPLORED
Why Scale Worked
- Why Hand-Built Knowledge Lost015✓ EXPLORED
Why Hand-Built Knowledge Lost
- Turning Text Into Numbers016✓ EXPLORED
Turning Text Into Numbers
- Tokens: How Language Becomes Something a Model Can Process017✓ EXPLORED
Tokens: How Language Becomes Something a Model Can Process
- Byte Pair Encoding018✓ EXPLORED
Byte Pair Encoding
- What Tokenisation Breaks019✓ EXPLORED
What Tokenisation Breaks
- Embeddings: Meaning as Direction020✓ EXPLORED
Embeddings: Meaning as Direction
- Living in 4,096 Dimensions021✓ EXPLORED
Living in 4,096 Dimensions
- Predicting the Next Token022✓ EXPLORED
Predicting the Next Token
- The Recurrent Era and Its Bottleneck023✓ EXPLORED
The Recurrent Era and Its Bottleneck
- One Word, Many Meanings024✓ EXPLORED
One Word, Many Meanings
- Vocabularies, Special Tokens and Chat Templates025✓ EXPLORED
Vocabularies, Special Tokens and Chat Templates
- Attention, Before the Maths026✓ EXPLORED
Attention, Before the Maths
- Queries, Keys and Values027✓ EXPLORED
Queries, Keys and Values
- Self-Attention, Step by Step028✓ EXPLORED
Self-Attention, Step by Step
- Multi-Head Attention029✓ EXPLORED
Multi-Head Attention
- The Causal Mask030✓ EXPLORED
The Causal Mask
- Position: Attention Has No Sense of Order031✓ EXPLORED
Position: Attention Has No Sense of Order
- Rotary Position Embeddings032✓ EXPLORED
Rotary Position Embeddings
- Models Without Positional Encoding033✓ EXPLORED
Models Without Positional Encoding
- The Feedforward Block034✓ EXPLORED
The Feedforward Block
- The Transformer Block, Assembled035✓ EXPLORED
The Transformer Block, Assembled
- The Residual Stream036✓ EXPLORED
The Residual Stream
- Encoder, Decoder, or Both037✓ EXPLORED
Encoder, Decoder, or Both
- Why Attention Gets Expensive038✓ EXPLORED
Why Attention Gets Expensive
- FlashAttention039✓ EXPLORED
FlashAttention
- Multi-Query and Grouped-Query Attention040✓ EXPLORED
Multi-Query and Grouped-Query Attention
- Alternatives to Attention041✓ EXPLORED
Alternatives to Attention
- Logits and the Softmax042✓ EXPLORED
Logits and the Softmax
- Temperature043✓ EXPLORED
Temperature
- Top-k, Top-p and Min-p044✓ EXPLORED
Top-k, Top-p and Min-p
- The Context Window045✓ EXPLORED
The Context Window
- Long Context Is Not Uniform Attention046✓ EXPLORED
Long Context Is Not Uniform Attention
- The KV Cache047✓ EXPLORED
The KV Cache
- Prefill Versus Decode048✓ EXPLORED
Prefill Versus Decode
- Batching, Throughput and Latency049✓ EXPLORED
Batching, Throughput and Latency
- Speculative Decoding050✓ EXPLORED
Speculative Decoding
- Constrained and Structured Generation051✓ EXPLORED
Constrained and Structured Generation
- System Prompts and Instruction Hierarchy052✓ EXPLORED
System Prompts and Instruction Hierarchy
- Pretraining053✓ EXPLORED
Pretraining
- What Goes Into the Corpus054✓ EXPLORED
What Goes Into the Corpus
- Chinchilla and Compute-Optimal Training055✓ EXPLORED
Chinchilla and Compute-Optimal Training
- Supervised Fine-Tuning056✓ EXPLORED
Supervised Fine-Tuning
- RLHF057✓ EXPLORED
RLHF
- DPO and Direct Preference Learning058✓ EXPLORED
DPO and Direct Preference Learning
- Training Against Written Principles059✓ EXPLORED
Training Against Written Principles
- LoRA and Parameter-Efficient Fine-Tuning060✓ EXPLORED
LoRA and Parameter-Efficient Fine-Tuning
- Fine-Tune, Prompt, or Retrieve061✓ EXPLORED
Fine-Tune, Prompt, or Retrieve
- Catastrophic Forgetting062✓ EXPLORED
Catastrophic Forgetting
- The Emergent Abilities Argument063✓ EXPLORED
The Emergent Abilities Argument
- Chain of Thought064✓ EXPLORED
Chain of Thought
- Sampling Many Answers065✓ EXPLORED
Sampling Many Answers
- Test-Time Compute066✓ EXPLORED
Test-Time Compute
- Reasoning Models067✓ EXPLORED
Reasoning Models
- Mixture of Experts068✓ EXPLORED
Mixture of Experts
- Dense Versus Sparse Models069✓ EXPLORED
Dense Versus Sparse Models
- Distillation070✓ EXPLORED
Distillation
- Pruning071✓ EXPLORED
Pruning
- Looking Inside the Model072✓ EXPLORED
Looking Inside the Model
- Architectural Limits073✓ EXPLORED
Architectural Limits
- Why GPUs074✓ EXPLORED
Why GPUs
- VRAM: The Number That Decides Everything075✓ EXPLORED
VRAM: The Number That Decides Everything
- Bandwidth, Not FLOPs076✓ EXPLORED
Bandwidth, Not FLOPs
- Unified Memory077✓ EXPLORED
Unified Memory
- Quantisation078✓ EXPLORED
Quantisation
- GPTQ, AWQ and K-Quants079✓ EXPLORED
GPTQ, AWQ and K-Quants
- Model Formats: GGUF, Safetensors, MLX080✓ EXPLORED
Model Formats: GGUF, Safetensors, MLX
- Running an Open-Weight Model Locally081✓ EXPLORED
Running an Open-Weight Model Locally
- Why Long Context Eats Your RAM082✓ EXPLORED
Why Long Context Eats Your RAM
- Splitting a Model Across Machines083✓ EXPLORED
Splitting a Model Across Machines
- A Cluster of Personal Computers084✓ EXPLORED
A Cluster of Personal Computers
- Local Versus Cloud, Honestly085✓ EXPLORED
Local Versus Cloud, Honestly
- Embedding Models086✓ EXPLORED
Embedding Models
- Vector Search087✓ EXPLORED
Vector Search
- Retrieval-Augmented Generation088✓ EXPLORED
Retrieval-Augmented Generation
- Chunking and Reranking089✓ EXPLORED
Chunking and Reranking
- Tool Use and Function Calling090✓ EXPLORED
Tool Use and Function Calling
- Agents091✓ EXPLORED
Agents
- Standardised Tool Connections092✓ EXPLORED
Standardised Tool Connections
- Multimodal Models093✓ EXPLORED
Multimodal Models
- Diffusion and Image Generation094✓ EXPLORED
Diffusion and Image Generation
- Speech Recognition and Synthesis095✓ EXPLORED
Speech Recognition and Synthesis
- Hallucination096✓ EXPLORED
Hallucination
- Evaluating Models097✓ EXPLORED
Evaluating Models
- Bias, Harm and Safety Training098✓ EXPLORED
Bias, Harm and Safety Training
- Prompt Injection099✓ EXPLORED
Prompt Injection
- Open Weights, Closed Frontiers100✓ EXPLORED
Open Weights, Closed Frontiers
- Neural Tangent Kernel Analysis101✓ EXPLORED
Neural Tangent Kernel Analysis
- Diffusion Model ODE/SDE Frameworks102✓ EXPLORED
Diffusion Model ODE/SDE Frameworks
- Sparse Mixture of Experts Routing103✓ EXPLORED
Sparse Mixture of Experts Routing
- Transformer Neural Machine Translation104✓ EXPLORED
Transformer Neural Machine Translation
JUNE 2017
- Vision-Language Navigation105✓ EXPLORED
Vision-Language Navigation
- Model-Based Reinforcement Learning with MuZero106✓ EXPLORED
Model-Based Reinforcement Learning with MuZero
- BIG-bench Collaborative Benchmark107✓ EXPLORED
BIG-bench Collaborative Benchmark
- Mechanistic Probes for Circuit Discovery108✓ EXPLORED
Mechanistic Probes for Circuit Discovery
- Blockwise Quantization-Aware Training109✓ EXPLORED
Blockwise Quantization-Aware Training
- Dataset Distillation110✓ EXPLORED
Dataset Distillation
- AI and Neuroscience Cross-Pollination111✓ EXPLORED
AI and Neuroscience Cross-Pollination
- Layer-wise Adaptive Rate Scaling (LARS)112✓ EXPLORED
Layer-wise Adaptive Rate Scaling (LARS)
- vLLM: PagedAttention for LLM Serving113✓ EXPLORED
vLLM: PagedAttention for LLM Serving
- Unified MultiModal Embedding with ImageBind114✓ EXPLORED
Unified MultiModal Embedding with ImageBind
- Hindsight Experience Replay115✓ EXPLORED
Hindsight Experience Replay
- Holistic Evaluation of Language Models (HELM)116✓ EXPLORED
Holistic Evaluation of Language Models (HELM)
- Sparse Autoencoders for Feature Discovery117✓ EXPLORED
Sparse Autoencoders for Feature Discovery
- Sliding Window Attention for Long Sequences118✓ EXPLORED
Sliding Window Attention for Long Sequences
- Web-Scale Text Corpora Curation119✓ EXPLORED
Web-Scale Text Corpora Curation
- Graph Attention Networks120✓ EXPLORED
Graph Attention Networks
- Fourier Features for Positional Encoding121✓ EXPLORED
Fourier Features for Positional Encoding
- Orca: System for Distributed Inference122✓ EXPLORED
Orca: System for Distributed Inference
- Audio-Visual Contrastive Learning123✓ EXPLORED
Audio-Visual Contrastive Learning
- Self-Play with Population-Based Training124✓ EXPLORED
Self-Play with Population-Based Training
- Anthropic's Redwood Research Interpretability125✓ EXPLORED
Anthropic's Redwood Research Interpretability
- TruthfulQA: Measuring Truthfulness126✓ EXPLORED
TruthfulQA: Measuring Truthfulness
- Causal Mediation Analysis in Neural Networks127✓ EXPLORED
Causal Mediation Analysis in Neural Networks
- Activation Sparsity via ReLU Pruning128✓ EXPLORED
Activation Sparsity via ReLU Pruning
- Crowdsourcing High-Quality Human Feedback129✓ EXPLORED
Crowdsourcing High-Quality Human Feedback
- BERT and the Masked Language Modeling Revolution130✓ EXPLORED
BERT and the Masked Language Modeling Revolution
- Stable Diffusion Architecture131✓ EXPLORED
Stable Diffusion Architecture
- Hyperparameter Transfer Learning132✓ EXPLORED
Hyperparameter Transfer Learning
- TensorRT and Kernel Fusion133✓ EXPLORED
TensorRT and Kernel Fusion
- NeRF: Neural Radiance Fields134✓ EXPLORED
NeRF: Neural Radiance Fields
- Mixture of Experts Routing135✓ EXPLORED
Mixture of Experts Routing
- Sparse Transformer with Local Attention136✓ EXPLORED
Sparse Transformer with Local Attention
- Low-Rank Adaptation (LoRA)137✓ EXPLORED
Low-Rank Adaptation (LoRA)
- Gradient Checkpointing for Memory-Efficient Training138✓ EXPLORED
Gradient Checkpointing for Memory-Efficient Training
- Model Soups: Weight Averaging for Improved Robustness139✓ EXPLORED
Model Soups: Weight Averaging for Improved Robustness
- Manifold Mixup for Better Representations140✓ EXPLORED
Manifold Mixup for Better Representations
- Speculative Decoding for Faster LLM Inference141✓ EXPLORED
Speculative Decoding for Faster LLM Inference
- Multimodal Chain-of-Thought Reasoning142✓ EXPLORED
Multimodal Chain-of-Thought Reasoning
- Preference Optimization via Nash Learning143✓ EXPLORED
Preference Optimization via Nash Learning
- Red Teaming with Language Models144✓ EXPLORED
Red Teaming with Language Models
- Mechanistic Interpretability of Induction Heads145✓ EXPLORED
Mechanistic Interpretability of Induction Heads
- Extreme Low-Bit Post-Training Quantization146✓ EXPLORED
Extreme Low-Bit Post-Training Quantization
- Data Selection via Perplexity for Language Model Training147✓ EXPLORED
Data Selection via Perplexity for Language Model Training
- The Deep Learning Hardware Revolution148✓ EXPLORED
The Deep Learning Hardware Revolution
- Vector-Quantized Variational Autoencoders (VQ-VAE)149✓ EXPLORED
Vector-Quantized Variational Autoencoders (VQ-VAE)
- Gradient-Based Meta-Learning (MAML)150✓ EXPLORED
Gradient-Based Meta-Learning (MAML)
- Sharpness-Aware Minimization (SAM)151✓ EXPLORED
Sharpness-Aware Minimization (SAM)
- Paged Attention for Efficient Memory Management152✓ EXPLORED
Paged Attention for Efficient Memory Management
- Unified Embedding Space for All Modalities153✓ EXPLORED
Unified Embedding Space for All Modalities
- Multi-Agent Deep Reinforcement Learning with Centralized Critics154✓ EXPLORED
Multi-Agent Deep Reinforcement Learning with Centralized Critics
- Scalable Oversight via Recursive Reward Modeling155✓ EXPLORED
Scalable Oversight via Recursive Reward Modeling
- Benchmarking Hallucination in Language Models156✓ EXPLORED
Benchmarking Hallucination in Language Models
- Activation Compression via Quantized Training157✓ EXPLORED
Activation Compression via Quantized Training
- Deduplication of Massive Training Datasets158✓ EXPLORED
Deduplication of Massive Training Datasets
- The Transformer Architecture Paper159✓ EXPLORED
The Transformer Architecture Paper
- Recurrent Independent Mechanisms160✓ EXPLORED
Recurrent Independent Mechanisms
- Self-Supervised Learning of Visual Features via Contrastive Loss161✓ EXPLORED
Self-Supervised Learning of Visual Features via Contrastive Loss
- AdaFactor: Adaptive Learning Rates with Sublinear Memory162✓ EXPLORED
AdaFactor: Adaptive Learning Rates with Sublinear Memory
- Continuous Batching in LLM Serving163✓ EXPLORED
Continuous Batching in LLM Serving
- Compositional Visual Reasoning with Neural Module Networks164✓ EXPLORED
Compositional Visual Reasoning with Neural Module Networks
- Reward Model Overoptimization165✓ EXPLORED
Reward Model Overoptimization
- TruthfulQA: Benchmarking Tendency to Generate Falsehoods166✓ EXPLORED
TruthfulQA: Benchmarking Tendency to Generate Falsehoods
- Causal Abstraction for Model Verification167✓ EXPLORED
Causal Abstraction for Model Verification
- Sliding Window Attention for Infinite Context168✓ EXPLORED
Sliding Window Attention for Infinite Context
- Model Contamination Detection in Benchmarks169✓ EXPLORED
Model Contamination Detection in Benchmarks
- The Bitter Lesson of Compute and Scale170✓ EXPLORED
The Bitter Lesson of Compute and Scale
- Vision Transformer (ViT) Scaling171✓ EXPLORED
Vision Transformer (ViT) Scaling
- Gradient Surgery for Multi-Task Learning172✓ EXPLORED
Gradient Surgery for Multi-Task Learning
- Sparse Mixture of Experts Inference Routing173✓ EXPLORED
Sparse Mixture of Experts Inference Routing
- Neural Tangent Kernel Theory for Wide Networks174✓ EXPLORED
Neural Tangent Kernel Theory for Wide Networks
- Transformer Memory Compression via Sliding Windows175✓ EXPLORED
Transformer Memory Compression via Sliding Windows
- Neural Radiance Fields for 3D Reconstruction176✓ EXPLORED
Neural Radiance Fields for 3D Reconstruction
- Soft Actor-Critic with Maximum Entropy177✓ EXPLORED
Soft Actor-Critic with Maximum Entropy
- Red Teaming for Language Model Safety178✓ EXPLORED
Red Teaming for Language Model Safety
- Benchmarking Compositional Generalization179✓ EXPLORED
Benchmarking Compositional Generalization
- Mechanistic Interpretability of Grokking180✓ EXPLORED
Mechanistic Interpretability of Grokking
- Speculative Decoding for Faster Inference181✓ EXPLORED
Speculative Decoding for Faster Inference
- Text-to-3D Generation with Score Distillation182✓ EXPLORED
Text-to-3D Generation with Score Distillation
- Human Feedback from Comparisons183✓ EXPLORED
Human Feedback from Comparisons
- Mixture Density Networks for Uncertainty184✓ EXPLORED
Mixture Density Networks for Uncertainty
- Coresets for Efficient Dataset Summarization185✓ EXPLORED
Coresets for Efficient Dataset Summarization
- Knowledge Distillation from Multiple Teachers186✓ EXPLORED
Knowledge Distillation from Multiple Teachers
- Weight Agnostic Neural Architecture Search187✓ EXPLORED
Weight Agnostic Neural Architecture Search
- Deep Double Descent: Beyond U-Shaped Risk188✓ EXPLORED
Deep Double Descent: Beyond U-Shaped Risk
- Volumetric Rendering with Neural Graphics Primitives189✓ EXPLORED
Volumetric Rendering with Neural Graphics Primitives
- Multi-Task Learning with Task Balancing190✓ EXPLORED
Multi-Task Learning with Task Balancing
- Efficient ViT with Shifted Windows191✓ EXPLORED
Efficient ViT with Shifted Windows
- No-Regret Online Learning to Nash Equilibrium192✓ EXPLORED
No-Regret Online Learning to Nash Equilibrium
- Model Parallelism with Pipeline Bubbles193✓ EXPLORED
Model Parallelism with Pipeline Bubbles
- Video Diffusion with Temporal Consistency194✓ EXPLORED
Video Diffusion with Temporal Consistency
- Recursive Reward Modeling for Scalable Oversight195✓ EXPLORED
Recursive Reward Modeling for Scalable Oversight
- Out-of-Distribution Detection via Likelihood Ratios196✓ EXPLORED
Out-of-Distribution Detection via Likelihood Ratios
- Causal Abstraction via Interchange Interventions197✓ EXPLORED
Causal Abstraction via Interchange Interventions
- Quantization with Learned Rounding198✓ EXPLORED
Quantization with Learned Rounding
- Data Valuation with Shapley Values199✓ EXPLORED
Data Valuation with Shapley Values
- Transformer Positional Encoding Alternatives200✓ EXPLORED
Transformer Positional Encoding Alternatives
- Memory-Efficient Backpropagation with Reversible Layers201✓ EXPLORED
Memory-Efficient Backpropagation with Reversible Layers
- Audio-Driven Talking Head Generation202✓ EXPLORED
Audio-Driven Talking Head Generation
- Constitutional AI for Harmless Assistance203✓ EXPLORED
Constitutional AI for Harmless Assistance
- Adversarial Evaluation of Multimodal Reasoning204✓ EXPLORED
Adversarial Evaluation of Multimodal Reasoning
- Sparse Autoencoders for Dictionary Learning205✓ EXPLORED
Sparse Autoencoders for Dictionary Learning
- Dynamic Quantization During Serving206✓ EXPLORED
Dynamic Quantization During Serving
- Synthetic Data Generation with Differential Privacy207✓ EXPLORED
Synthetic Data Generation with Differential Privacy
- History: The 2012 AlexNet Revolution208✓ EXPLORED
History: The 2012 AlexNet Revolution
- Graph Transformers with Structural Encodings209✓ EXPLORED
Graph Transformers with Structural Encodings
- Optimization Theory for Adaptive Gradient Methods210✓ EXPLORED
Optimization Theory for Adaptive Gradient Methods
- Multi-Task Reinforcement Learning with Shared Representations211✓ EXPLORED
Multi-Task Reinforcement Learning with Shared Representations
- Differentiable Architecture Search212✓ EXPLORED
Differentiable Architecture Search
- Mixture of Experts: Sparse Routing at Scale213✓ EXPLORED
Mixture of Experts: Sparse Routing at Scale
- Retentive Networks for Long Sequences214✓ EXPLORED
Retentive Networks for Long Sequences
- State Space Models for Long Sequences215✓ EXPLORED
State Space Models for Long Sequences
- Differential Privacy by Noising Gradients216✓ EXPLORED
Differential Privacy by Noising Gradients
- Progressive Growing of GANs217✓ EXPLORED
Progressive Growing of GANs
- Meta-Learning with External Memory218✓ EXPLORED
Meta-Learning with External Memory
- Loss Landscapes: Flat Minima and Sharp Ones219✓ EXPLORED
Loss Landscapes: Flat Minima and Sharp Ones
- The Information Bottleneck220✓ EXPLORED
The Information Bottleneck
- The Lottery Ticket Hypothesis221✓ EXPLORED
The Lottery Ticket Hypothesis
- The Neural Tangent Kernel222✓ EXPLORED
The Neural Tangent Kernel
- Feature Learning: The Lazy-to-Rich Transition223✓ EXPLORED
Feature Learning: The Lazy-to-Rich Transition
- Emergence: Abilities That Appear Only With Scale224✓ EXPLORED
Emergence: Abilities That Appear Only With Scale
- KV Cache Compression for Long Context225✓ EXPLORED
KV Cache Compression for Long Context
- Predictive Auto-Scaling for Model Serving226✓ EXPLORED
Predictive Auto-Scaling for Model Serving
- Elastic Training: Surviving a Lost Machine227✓ EXPLORED
Elastic Training: Surviving a Lost Machine
- near‑data‑processing-for-embedding-lookup228✓ EXPLORED
near‑data‑processing-for-embedding-lookup
- Contrastive Learning Across Vision, Audio and Text229✓ EXPLORED
Contrastive Learning Across Vision, Audio and Text
- Vision-Language-Action Models for Robotics230✓ EXPLORED
Vision-Language-Action Models for Robotics
- World Models: Planning Inside a Learned Simulator231✓ EXPLORED
World Models: Planning Inside a Learned Simulator
- Imitation Learning from Observation232✓ EXPLORED
Imitation Learning from Observation
- Model-Based RL and the Limits of a Learned Simulator233✓ EXPLORED
Model-Based RL and the Limits of a Learned Simulator
- Inverse Reinforcement Learning234✓ EXPLORED
Inverse Reinforcement Learning
- Trojans and Backdoors: Models with Hidden Triggers235✓ EXPLORED
Trojans and Backdoors: Models with Hidden Triggers
- evaluation-with-adversarial-n‑way-forcing236✓ EXPLORED
evaluation-with-adversarial-n‑way-forcing
- Calibration: When Confidence Matches Correctness237✓ EXPLORED
Calibration: When Confidence Matches Correctness
- Probing for Linguistic Knowledge238✓ EXPLORED
Probing for Linguistic Knowledge
- Ablation: Reading Function by Removing Parts239✓ EXPLORED
Ablation: Reading Function by Removing Parts
- LoRA: Low-Rank Fine-Tuning240✓ EXPLORED
LoRA: Low-Rank Fine-Tuning
- Synthetic Data for Data-Scarce Domains241✓ EXPLORED
Synthetic Data for Data-Scarce Domains
- Active Learning: Choosing What to Label242✓ EXPLORED
Active Learning: Choosing What to Label
- Cleaning Web-Scale Training Data243✓ EXPLORED
Cleaning Web-Scale Training Data
- Connectionism versus Symbolism244✓ EXPLORED
Connectionism versus Symbolism
- The Rise of Self-Supervised Learning245✓ EXPLORED
The Rise of Self-Supervised Learning
- Vision-Transformer Hybrid Architectures246✓ EXPLORED
Vision-Transformer Hybrid Architectures
- MoE Routing Strategies247✓ EXPLORED
MoE Routing Strategies
- Model Merging via Weight Interpolation248✓ EXPLORED
Model Merging via Weight Interpolation
- Mechanistic Interpretability of In-Context Learning249✓ EXPLORED
Mechanistic Interpretability of In-Context Learning
- Retentive Networks (RetNet)250✓ EXPLORED
Retentive Networks (RetNet)
- JEPA and I-JEPA251✓ EXPLORED
JEPA and I-JEPA
- Preference Optimization with DPO252✓ EXPLORED
Preference Optimization with DPO
- Temporal Difference Learning Theory253✓ EXPLORED
Temporal Difference Learning Theory
- Memorization vs. Generalization in Large Models254✓ EXPLORED
Memorization vs. Generalization in Large Models
- Model-Based RL with Learned Dynamics255✓ EXPLORED
Model-Based RL with Learned Dynamics
- FP8 Training and Inference256UNOPENED
FP8 Training and Inference
- Scaling Laws for Transfer257UNOPENED
Scaling Laws for Transfer
- Diffusion Transformers (DiT)258UNOPENED
Diffusion Transformers (DiT)
- Conformal Prediction for LLMs259UNOPENED
Conformal Prediction for LLMs
- Parallel Context Windows260UNOPENED
Parallel Context Windows
- Offline RL with Conservative Q-Learning261✓ EXPLORED
Offline RL with Conservative Q-Learning
- Tool-Integrated Language Agents262UNOPENED
Tool-Integrated Language Agents
- Gated Linear Units263UNOPENED
Gated Linear Units
- Dataset Poisoning Attacks264UNOPENED
Dataset Poisoning Attacks
- Hypernetworks for Parameter Generation265UNOPENED
Hypernetworks for Parameter Generation
- Learning from Positive-Unlabeled Data266UNOPENED
Learning from Positive-Unlabeled Data
- Optimal Transport for Domain Adaptation267UNOPENED
Optimal Transport for Domain Adaptation
- Conditional Computation with Mixture-of-Experts268UNOPENED
Conditional Computation with Mixture-of-Experts
- Emergent World Models in RL269UNOPENED
Emergent World Models in RL
- Soft Prompt Tuning270UNOPENED
Soft Prompt Tuning
- Gradient Compression for Distributed Training271UNOPENED
Gradient Compression for Distributed Training
- Nonparametric Bayesian Deep Learning272UNOPENED
Nonparametric Bayesian Deep Learning
- Neural Architecture Search with Weight Sharing273UNOPENED
Neural Architecture Search with Weight Sharing
- Dynamic Evaluation of Language Models274UNOPENED
Dynamic Evaluation of Language Models
- Feature Visualization with Multidimensional Scaling275UNOPENED
Feature Visualization with Multidimensional Scaling
- Sparse Transformers with Factorized Attention276UNOPENED
Sparse Transformers with Factorized Attention
- Perceiver IO: General Perception with Iterative Attention277UNOPENED
Perceiver IO: General Perception with Iterative Attention
- Mixture of Depths: Dynamically Allocating Compute278UNOPENED
Mixture of Depths: Dynamically Allocating Compute
- Monarch Matrices for Efficient Linear Layers279UNOPENED
Monarch Matrices for Efficient Linear Layers
- Kernel Methods Meet Transformers280UNOPENED
Kernel Methods Meet Transformers
- Neural Tangent Kernel Theory for Deep Learning281UNOPENED
Neural Tangent Kernel Theory for Deep Learning
- Grokking: Generalization Beyond Overfitting282UNOPENED
Grokking: Generalization Beyond Overfitting
- RL from Imperfect Human Feedback283UNOPENED
RL from Imperfect Human Feedback
- PagedAttention for Efficient KV Cache Management284UNOPENED
PagedAttention for Efficient KV Cache Management
- Retentive Networks as a Transformer Alternative285UNOPENED
Retentive Networks as a Transformer Alternative
- Mamba: Selective State Space Models286UNOPENED
Mamba: Selective State Space Models
- RLHF vs. DPO: Direct Preference Optimization287UNOPENED
RLHF vs. DPO: Direct Preference Optimization
- Lion Optimizer: Sign-based Adaptive Learning288UNOPENED
Lion Optimizer: Sign-based Adaptive Learning
- MuJoCo and the Physics-Based RL Benchmark289UNOPENED
MuJoCo and the Physics-Based RL Benchmark
- Beyond Accuracy: Calibration and ECE290UNOPENED
Beyond Accuracy: Calibration and ECE
- LoRA: Low-Rank Adaptation of Large Models291UNOPENED
LoRA: Low-Rank Adaptation of Large Models
- Data Management for Lifelong Learning292UNOPENED
Data Management for Lifelong Learning
- Weak-to-Strong Generalization293UNOPENED
Weak-to-Strong Generalization
- Superposition and Polysemantic Neurons294UNOPENED
Superposition and Polysemantic Neurons
- The Bitter Lesson of Search and Learning295UNOPENED
The Bitter Lesson of Search and Learning
- Intrinsic Dimension of Model Manifolds296UNOPENED
Intrinsic Dimension of Model Manifolds
- Cross-Modal Retrieval with Contrastive Pre-training297UNOPENED
Cross-Modal Retrieval with Contrastive Pre-training
- Amortized Bayesian Inference with Normalizing Flows298UNOPENED
Amortized Bayesian Inference with Normalizing Flows
- Self-Supervised Learning of Visual Representations299UNOPENED
Self-Supervised Learning of Visual Representations
- Adversarial Attacks on Semantic Segmentation300UNOPENED
Adversarial Attacks on Semantic Segmentation
- Simulated Annealing for Architecture Search301UNOPENED
Simulated Annealing for Architecture Search
- Quantization of Activations with Dynamic Ranges302UNOPENED
Quantization of Activations with Dynamic Ranges
- Temporal Difference Learning in Deep RL303UNOPENED
Temporal Difference Learning in Deep RL
- Information Bottleneck in Deep Learning304UNOPENED
Information Bottleneck in Deep Learning
- Transformer Inductive Bias Analysis305UNOPENED
Transformer Inductive Bias Analysis
- Reward Modeling with Human Feedback306UNOPENED
Reward Modeling with Human Feedback
- Mechanistic Interpretability of Attention Heads307UNOPENED
Mechanistic Interpretability of Attention Heads
- Sliding Window Attention308UNOPENED
Sliding Window Attention
- Data Scarcity with Synthetic Pre-training309UNOPENED
Data Scarcity with Synthetic Pre-training
- The Stochastic Gradient Descent Revolution310UNOPENED
The Stochastic Gradient Descent Revolution
- Mixture of Experts Routing Strategies311UNOPENED
Mixture of Experts Routing Strategies
- Gradient Checkpointing for Memory Efficiency312UNOPENED
Gradient Checkpointing for Memory Efficiency
- Implicit Gradient Regularization313UNOPENED
Implicit Gradient Regularization
- Grokkking Phenomenon Analysis314UNOPENED
Grokkking Phenomenon Analysis
- KV Cache Compression315UNOPENED
KV Cache Compression
- Visual Question Answering with External Knowledge316UNOPENED
Visual Question Answering with External Knowledge
- Interpretable Reward Functions317UNOPENED
Interpretable Reward Functions
- Measuring Neural Network Calibration318UNOPENED
Measuring Neural Network Calibration
- Causal Mediation Analysis in Vision Models319UNOPENED
Causal Mediation Analysis in Vision Models
- Adaptive Computation Time320UNOPENED
Adaptive Computation Time
- Perceptron to Deep Learning Transition321UNOPENED
Perceptron to Deep Learning Transition
- State Space Models for Long Sequences322UNOPENED
State Space Models for Long Sequences
- ZeRO: Zero Redundancy Optimizer323UNOPENED
ZeRO: Zero Redundancy Optimizer
- Second Order Optimization for Deep Learning324UNOPENED
Second Order Optimization for Deep Learning
- Model Parallelism Strategies325UNOPENED
Model Parallelism Strategies
- Audio-Visual Speech Separation326UNOPENED
Audio-Visual Speech Separation
- Exploration with Intrinsic Curiosity327UNOPENED
Exploration with Intrinsic Curiosity
- AI Deception Detection and Prevention328UNOPENED
AI Deception Detection and Prevention
- Adversarial Evaluation of Reasoning329UNOPENED
Adversarial Evaluation of Reasoning
- Representation Similarity Analysis330UNOPENED
Representation Similarity Analysis
- Dynamic Sparsity During Training331UNOPENED
Dynamic Sparsity During Training
- Graph Neural Networks for Relational Reasoning332UNOPENED
Graph Neural Networks for Relational Reasoning
- Meta-Learning Initializations333UNOPENED
Meta-Learning Initializations
- Neural Architecture Search Fundamentals334UNOPENED
Neural Architecture Search Fundamentals
- Neural Architecture Search with Differentiable Supernets335UNOPENED
Neural Architecture Search with Differentiable Supernets
- Sparse Mixture-of-Experts for Trillion-Parameter Models336UNOPENED
Sparse Mixture-of-Experts for Trillion-Parameter Models
- Hybrid CNN-Transformer Architectures337UNOPENED
Hybrid CNN-Transformer Architectures
- Meta-Learning for Fast Adaptation (MAML)338UNOPENED
Meta-Learning for Fast Adaptation (MAML)
- Self-Supervised Learning via Contrastive Predictive Coding339UNOPENED
Self-Supervised Learning via Contrastive Predictive Coding
- Adaptive Gradient Methods with Dynamic Bound340UNOPENED
Adaptive Gradient Methods with Dynamic Bound
- KV Cache Quantization and Management341UNOPENED
KV Cache Quantization and Management
- Learning Joint Embeddings for Vision and Language342UNOPENED
Learning Joint Embeddings for Vision and Language
- Model-Based Reinforcement Learning with Learned Dynamics343UNOPENED
Model-Based Reinforcement Learning with Learned Dynamics
- Offline Reinforcement Learning with Conservative Q-Learning344UNOPENED
Offline Reinforcement Learning with Conservative Q-Learning
- AI Safety via Adversarial Robustness345UNOPENED
AI Safety via Adversarial Robustness
- Scalable Oversight with Recursive Reward Modeling346UNOPENED
Scalable Oversight with Recursive Reward Modeling
- Evaluating Compositional Generalization with SCAN347UNOPENED
Evaluating Compositional Generalization with SCAN
- Massive Multitask Language Understanding Benchmark (MMLU)348UNOPENED
Massive Multitask Language Understanding Benchmark (MMLU)
- Probing Classifiers for Latent Concept Discovery349UNOPENED
Probing Classifiers for Latent Concept Discovery
- Activation Quantization for Efficient Inference350UNOPENED
Activation Quantization for Efficient Inference
- Structured Pruning with Lasso and Rewinding351UNOPENED
Structured Pruning with Lasso and Rewinding
- Data Augmentation with Learned Semantic Transformations352UNOPENED
Data Augmentation with Learned Semantic Transformations
- Data Valuation with the Data Shapley353UNOPENED
Data Valuation with the Data Shapley
- The AI Winter and Its Causes354UNOPENED
The AI Winter and Its Causes
- The ImageNet Moment and the Dawn of Deep Learning355UNOPENED
The ImageNet Moment and the Dawn of Deep Learning
- Transformers with Linear Attention356UNOPENED
Transformers with Linear Attention
- Training Dynamics of Large Language Models357UNOPENED
Training Dynamics of Large Language Models
- Optimization for Non-Convex Landscapes with Entropy-SGD358UNOPENED
Optimization for Non-Convex Landscapes with Entropy-SGD
- Universality and Approximation Theory of Neural Networks359UNOPENED
Universality and Approximation Theory of Neural Networks
- PagedAttention for Efficient Memory Management in LLM Serving360UNOPENED
PagedAttention for Efficient Memory Management in LLM Serving
- Generative Models for 3D-Aware Image Synthesis361UNOPENED
Generative Models for 3D-Aware Image Synthesis
- Hierarchical Reinforcement Learning with Skills362UNOPENED
Hierarchical Reinforcement Learning with Skills
- Anomaly Detection for AI Misalignment363UNOPENED
Anomaly Detection for AI Misalignment
- Automated Circuit Discovery in Vision Transformers364UNOPENED
Automated Circuit Discovery in Vision Transformers
- Dynamic Sparsity via RigL (Rigged Lottery)365UNOPENED
Dynamic Sparsity via RigL (Rigged Lottery)