LLM : ce qui se passe vraiment du token à la réponse
Summary
Cet article décrit ce qui se passe vraiment dans un LLM de l'entrée à la sortie: décomposition en tokens, embeddings et architecture Transformer, puis pré-entraînement et post-entraînement, et enfin l'inférence avec les techniques KV cache et décodage séquentiel. Il aborde aussi les approches d'optimisation comme GQA, FlashAttention, MoE et quantification, ainsi que des méthodes complémentaires comme RAG et LoRA pour améliorer le déploiement et la capacité du modèle.