Resources & reading¶
A curated, opinionated reading list across the pipeline. Not exhaustive — meant to be read.
For inspiration, see Andrej Karpathy's original knowledge-base gist and his Intro to LLMs talk.
Foundational papers (must-read)¶
- Vaswani et al., "Attention Is All You Need", 2017. The Transformer. arxiv.org/abs/1706.03762
- Brown et al., "Language Models are Few-Shot Learners" (GPT-3), 2020. arxiv.org/abs/2005.14165
- Kaplan et al., "Scaling Laws", 2020. arxiv.org/abs/2001.08361
- Hoffmann et al., "Chinchilla", 2022. arxiv.org/abs/2203.15556
- Ouyang et al., "InstructGPT", 2022. arxiv.org/abs/2203.02155
- Bai et al., "Constitutional AI", 2022. arxiv.org/abs/2212.08073
- Rafailov et al., "DPO", 2023. arxiv.org/abs/2305.18290
Reference modern recipes (open-weights)¶
- Llama 3 paper, Meta, 2024. The most comprehensive single-paper modern recipe. arxiv.org/abs/2407.21783
- OLMo 2, AI2, 2024. Fully open weights, data, recipe. arxiv.org/abs/2501.00656
- Tülu 3, AI2, 2024. The clearest open post-training recipe with RLVR. arxiv.org/abs/2411.15124
- DeepSeek-V3 technical report, 2024. SOTA open MoE. arxiv.org/abs/2412.19437
- DeepSeek-R1, 2025. RL-trained reasoning model. arxiv.org/abs/2501.12948
- Qwen 2.5 technical report, 2024. Strong open recipe with detailed report.
- MiniCPM technical report, 2024. Excellent practical writeup of small-model training. arxiv.org/abs/2404.06395
- Mixtral 8×7B paper, Mistral, 2024. Reference open MoE. arxiv.org/abs/2401.04088
Data¶
- The Pile — Gao et al., 2020. arxiv.org/abs/2101.00027
- RefinedWeb — Penedo et al., 2023. arxiv.org/abs/2306.01116
- FineWeb / FineWeb-Edu — HuggingFace, 2024. huggingface.co/spaces/HuggingFaceFW/blogpost-fineweb-v1
- Dolma — AI2, 2024. arxiv.org/abs/2402.00159
- DataComp-LM, 2024. arxiv.org/abs/2406.11794
- Lee et al., "Deduplicating Training Data", 2021. arxiv.org/abs/2107.06499
- Carlini et al., "Quantifying Memorization", 2022. arxiv.org/abs/2202.07646
- Albalak et al., "A Survey on Data Selection", 2024. arxiv.org/abs/2402.16827
- CulturaX — multilingual web. arxiv.org/abs/2309.09400
- The Stack v2 — code corpus. huggingface.co/datasets/bigcode/the-stack-v2
Architecture¶
- RoPE — Su et al., 2021. arxiv.org/abs/2104.09864
- GQA — Ainslie et al., 2023. arxiv.org/abs/2305.13245
- SwiGLU — Shazeer, 2020. arxiv.org/abs/2002.05202
- RMSNorm — Zhang & Sennrich, 2019. arxiv.org/abs/1910.07467
- The Annotated Transformer — Harvard NLP. nlp.seas.harvard.edu/annotated-transformer
Pretraining mechanics¶
- µP (Tensor Programs V) — Yang et al., 2022. arxiv.org/abs/2203.03466
- ZeRO — Rajbhandari et al., 2019. arxiv.org/abs/1910.02054
- Megatron-LM — Shoeybi et al., 2019. arxiv.org/abs/1909.08053
- FlashAttention — Dao et al., 2022. arxiv.org/abs/2205.14135
- FlashAttention-2 — Dao, 2023. arxiv.org/abs/2307.08691
Long context¶
- Position Interpolation — Chen et al., 2023. arxiv.org/abs/2306.15595
- YaRN — Peng et al., 2023. arxiv.org/abs/2309.00071
- LongRoPE — Microsoft, 2024. arxiv.org/abs/2402.13753
- Lost in the Middle — Liu et al., 2023. arxiv.org/abs/2307.03172
- RULER — Hsieh et al., 2024. arxiv.org/abs/2404.06654
Post-training¶
- InstructGPT — Ouyang et al., 2022. arxiv.org/abs/2203.02155
- HHH RLHF — Bai et al., 2022. arxiv.org/abs/2204.05862
- PPO — Schulman et al., 2017. arxiv.org/abs/1707.06347
- DPO — Rafailov et al., 2023. arxiv.org/abs/2305.18290
- IPO — Azar et al., 2023. arxiv.org/abs/2310.12036
- KTO — Ethayarajh et al., 2024. arxiv.org/abs/2402.01306
- ORPO — Hong et al., 2024. arxiv.org/abs/2403.07691
- SimPO — Meng et al., 2024. arxiv.org/abs/2405.14734
- GRPO / DeepSeekMath — Shao et al., 2024. arxiv.org/abs/2402.03300
- RLVR / Tülu 3 — Lambert et al., 2024. arxiv.org/abs/2411.15124
- Self-Rewarding LMs — Yuan et al., 2024. arxiv.org/abs/2401.10020
- LIMA — Zhou et al., 2023. arxiv.org/abs/2305.11206
- UltraFeedback — Cui et al., 2023. arxiv.org/abs/2310.01377
- Length bias in RLHF — Singhal et al., 2023. arxiv.org/abs/2310.03716
- RewardBench — Lambert et al., 2024. arxiv.org/abs/2403.13787
- Lightman et al., "Let's Verify Step by Step", 2023. arxiv.org/abs/2305.20050
Reasoning¶
- Wei et al., "Chain-of-Thought", 2022. arxiv.org/abs/2201.11903
- GSM8K — Cobbe et al., 2021. arxiv.org/abs/2110.14168
- MATH — Hendrycks et al., 2021. arxiv.org/abs/2103.03874
- DeepSeek-R1, 2025. arxiv.org/abs/2501.12948
- GPQA — Rein et al., 2023. arxiv.org/abs/2311.12022
Tool use & agents¶
- Toolformer — Schick et al., 2023. arxiv.org/abs/2302.04761
- ReAct — Yao et al., 2022. arxiv.org/abs/2210.03629
- Gorilla — Patil et al., 2023. arxiv.org/abs/2305.15334
- SWE-bench — Jimenez et al., 2024. arxiv.org/abs/2310.06770
- τ-bench, 2024. arxiv.org/abs/2406.12045
- WebArena, 2023. arxiv.org/abs/2307.13854
- Berkeley Function-Calling Leaderboard — gorilla.cs.berkeley.edu/leaderboard.html
RAG¶
- Lewis et al., "RAG", 2020. arxiv.org/abs/2005.11401
- Karpukhin et al., "DPR", 2020. arxiv.org/abs/2004.04906
- Self-RAG — Asai et al., 2023. arxiv.org/abs/2310.11511
- RAG survey — Gao et al., 2023. arxiv.org/abs/2312.10997
Structured output¶
- Outlines paper — Willard & Louf, 2023. arxiv.org/abs/2307.09702
- XGrammar — Dong et al., 2024. arxiv.org/abs/2411.15100
- OpenAI Structured Outputs — platform.openai.com/docs/guides/structured-outputs
Safety & red teaming¶
- Constitutional AI — Bai et al., 2022. arxiv.org/abs/2212.08073
- Llama Guard — Inan et al., 2023. arxiv.org/abs/2312.06674
- WildGuard — Han et al., 2024. arxiv.org/abs/2406.18495
- XSTest — Röttger et al., 2023. arxiv.org/abs/2308.01263
- HarmBench — Mazeika et al., 2024. arxiv.org/abs/2402.04249
- GCG attacks — Zou et al., 2023. arxiv.org/abs/2307.15043
- Indirect prompt injection — Greshake et al., 2023. arxiv.org/abs/2302.12173
- Anthropic Acceptable Use Policy — anthropic.com/legal/aup
- OpenAI Model Spec — openai.com/index/openai-model-spec
Multimodal¶
- CLIP — Radford et al., 2021. arxiv.org/abs/2103.00020
- SigLIP — Zhai et al., 2023. arxiv.org/abs/2303.15343
- LLaVA — Liu et al., 2023. arxiv.org/abs/2304.08485
- Qwen-VL — Bai et al., 2023. arxiv.org/abs/2308.12966
- Idefics2 — Laurençon et al., 2024. arxiv.org/abs/2405.02246
- MMMU benchmark, 2023. arxiv.org/abs/2311.16502
Compression & efficiency¶
- GPTQ — Frantar et al., 2022. arxiv.org/abs/2210.17323
- AWQ — Lin et al., 2023. arxiv.org/abs/2306.00978
- LoRA — Hu et al., 2021. arxiv.org/abs/2106.09685
- QLoRA — Dettmers et al., 2023. arxiv.org/abs/2305.14314
- Speculative decoding — Leviathan et al., 2022. arxiv.org/abs/2211.17192
- vLLM / PagedAttention — Kwon et al., 2023. arxiv.org/abs/2309.06180
Evaluation¶
- HELM — Liang et al., 2022. arxiv.org/abs/2211.09110
- MMLU — Hendrycks et al., 2020. arxiv.org/abs/2009.03300
- BIG-Bench Hard — Suzgun et al., 2022. arxiv.org/abs/2210.09261
- MT-Bench / Arena — Zheng et al., 2023. arxiv.org/abs/2306.05685
- AlpacaEval 2 LC — Dubois et al., 2024. arxiv.org/abs/2404.04475
- IFEval — Zhou et al., 2023. arxiv.org/abs/2311.07911
- SimpleQA — OpenAI, 2024. arxiv.org/abs/2411.04368
Tooling and frameworks¶
Training¶
nanoGPT— minimal Transformer training. github.com/karpathy/nanoGPTllm.c— Karpathy. CUDA Transformer training. github.com/karpathy/llm.ctorchtitan— PyTorch reference distributed training. github.com/pytorch/torchtitannanotron— HuggingFace's clean training library. github.com/huggingface/nanotron- Megatron-LM / Megatron-Core — NVIDIA. github.com/NVIDIA/Megatron-LM
- DeepSpeed — Microsoft. github.com/microsoft/DeepSpeed
Tokenization¶
minbpe— Karpathy. github.com/karpathy/minbpe- HuggingFace
tokenizers— github.com/huggingface/tokenizers tiktoken— OpenAI. github.com/openai/tiktokensentencepiece— Google. github.com/google/sentencepiece
Data¶
datatrove— HuggingFace. github.com/huggingface/datatrovetext-dedup— github.com/ChenghaoMou/text-deduppresidio— Microsoft PII detection. github.com/microsoft/presidio
Post-training¶
trl— HuggingFace. github.com/huggingface/trlaxolotl— community SFT/DPO. github.com/axolotl-ai-cloud/axolotlopen-instruct— AI2 / Tülu. github.com/allenai/open-instructOpenRLHF— distributed RLHF. github.com/OpenRLHF/OpenRLHFverl— open RL training framework. github.com/volcengine/verldistilabel— synthetic data. github.com/argilla-io/distilabel
Evaluation¶
lm-evaluation-harness— EleutherAI. github.com/EleutherAI/lm-evaluation-harnessinspect_ai— UK AISI. github.com/UKGovernmentBEIS/inspect_aievals— OpenAI. github.com/openai/evalslmms-eval— multimodal. github.com/EvolvingLMMs-Lab/lmms-eval
Serving¶
- vLLM — github.com/vllm-project/vllm
- SGLang — github.com/sgl-project/sglang
- TensorRT-LLM — github.com/NVIDIA/TensorRT-LLM
llama.cpp— github.com/ggerganov/llama.cpp- MLC LLM — github.com/mlc-ai/mlc-llm
Constrained decoding¶
- Outlines — github.com/dottxt-ai/outlines
xgrammar— github.com/mlc-ai/xgrammarlm-format-enforcer— github.com/noamgat/lm-format-enforcer
Red teaming¶
pyrit— Microsoft. github.com/Azure/PyRITgarak— github.com/leondz/garak
Excellent talks and writeups¶
- Andrej Karpathy — "Intro to Large Language Models" (1 hr). youtube.com/watch?v=zjkBMFhNj_g
- Karpathy — "Let's build GPT, from scratch" (2 hr). youtube.com/watch?v=kCc8FmEb1nY
- Karpathy — "Let's build the GPT Tokenizer" (2 hr). youtube.com/watch?v=zduSFxRajkE
- Karpathy — "Let's reproduce GPT-2 (124M)". youtube.com/watch?v=l8pRSuU81PU
- Karpathy's original LLM knowledge-base gist — the inspiration for this wiki. gist.github.com/karpathy/442a6bf555914893e9891c11519de94f
- Nathan Lambert's blog (Interconnects) — best practical post-training writing on the open web. interconnects.ai
- HuggingFace blog — many excellent practical posts on data, post-training, and serving.
- Sebastian Raschka — "Build a Large Language Model (From Scratch)" — the best book-length intro. github.com/rasbt/LLMs-from-scratch
- Lilian Weng's blog — careful, well-cited primers on most topics. lilianweng.github.io