huggingface/nanotron
Minimalistic large language model 3D-parallelism training
Ongoing research training transformer models at scale
Appears on
Quick read
Latest capture 2026-08-03 03:06
9 paths
Agent instructions and tool configuration found in this repository.
Agent instructions
Agent workspace 2
Claude Code 4
Cursor
Greptile
6 observed captures since 2026-05-25. Observed captures are shown by default.
Stars from first capture +857
Observed captures only
All tracked data
Observed snapshots
Observed snapshots
Nearest indexed repositories by embedding similarity.
Minimalistic large language model 3D-parallelism training
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
A Next-Generation Training Engine Built for Ultra-Large MoE Models
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
Go ahead and axolotl questions
DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.