机器学习工程
skillsmp.stas00-ml-engineering-skill-md
端到端训练与运维大规模 LLM/VLM/多模态模型的实战方法论与具体配方——选择并基准测试加速器、存储与网络;SLURM/Kubernetes 编排;最大化训练吞吐并在显存内装下模型;诊断并撑过训练不稳定、NaN/Inf 与硬件/作业故障;检查点与容错;推理性能与显存;调试多节点/多卡挂起;以及编写/运行测试。当用户在训练或微调大模型、遭遇低 TFLOPS/MFU、OOM、数据加载缓慢、损失尖峰/发散、NCCL/InfiniBand 或多节点挂起、节点/GPU 故障、检查点或抢占问题、存储/网络瓶颈,或需要挑选 GPU/云/文件系统,或估算推理延迟/吞吐时使用。提炼自《Machine Learning Engineering》,最新版本见 https://github.com/stas00/ml-engineering。