DigiNews

Tech Watch by Johan Denoyer

← Back to articles

LLM : ce qui se passe vraiment du token à la réponse

Quality: 8/10 Relevance: 9/10

Summary

Cet article décrit ce qui se passe vraiment dans un LLM de l'entrée à la sortie: décomposition en tokens, embeddings et architecture Transformer, puis pré-entraînement et post-entraînement, et enfin l'inférence avec les techniques KV cache et décodage séquentiel. Il aborde aussi les approches d'optimisation comme GQA, FlashAttention, MoE et quantification, ainsi que des méthodes complémentaires comme RAG et LoRA pour améliorer le déploiement et la capacité du modèle.

🚀 Service construit par Johan Denoyer