AI At Home Part 2: Multi GPU Drifting
Summary
A hands-on exploration of running and optimizing large language models on a four-GPU home server. It covers layer-parallel and tensor-parallel strategies, MoE vs dense models, draft/MTP workflows, and practical benchmarks, with detailed notes on memory, bandwidth, and power usage.