Tous les articles
IALLM

Auto-héberger un LLM sur un VPS : le guide réaliste

Publié le 12 septembre 2023 · 9 min de lecture

L'IA locale est devenue réaliste — avec des limites

Depuis la sortie de Llama 2 et de ses dérivés quantifiés, la même question revient chaque semaine au support : « puis-je faire tourner un LLM sur un de vos VPS ? ». Réponse honnête : oui, à condition de choisir la bonne taille de modèle et de savoir ce qu'un CPU peut — et ne peut pas — faire.

Ollama en cinq minutes

curl -fsSL https://ollama.com/install.sh | sh
ollama run llama2:7b-chat-q4_K_M

C'est tout. Ollama télécharge le modèle quantifié (environ 4 GB pour un 7B en Q4) et expose une API locale compatible avec la plupart des outils de l'écosystème.

CPU contre GPU : les vrais chiffres

Sur notre banc d'essai, un VPS Quantum (16 vCore EPYC, 64 GB DDR5) :

ModèleTokens/s (génération)RAM requise
7B Q4116 GB
13B Q4610 GB
34B Q42,522 GB
70B Q40,842 GB

Lecture : jusqu'à 13B, l'expérience est confortable pour un usage interactif en solo. Au-delà, la génération devient plus lente que la lecture humaine. Un GPU grand public fait 10 à 20 fois mieux — mais coûte 10 à 20 fois plus cher à louer.

Deux facteurs dominent sur CPU : la bande passante mémoire (les 12 canaux DDR5 de nos EPYC sont un vrai atout) et la fréquence. Le Ryzen 9 à 5,7 GHz sort 14 tokens/s sur un 7B — mieux que l'EPYC en mono-utilisateur, moins bien dès que les requêtes se parallélisent.

Les cas d'usage qui fonctionnent

  • Chatbot interne sur vos documents (RAG) : un 7B ou 13B suffit largement.
  • Résumé et extraction de texte en tâche de fond : la vitesse importe peu.
  • Traitement de données sensibles : rien ne quitte votre VPS — c'est la raison n°1 invoquée par nos clients pour auto-héberger.
  • Prototypage avant d'investir dans du GPU.

Ce qui ne fonctionne pas

Servir 50 utilisateurs simultanés en temps réel sur un 34B, fine-tuner un modèle, ou approcher la qualité d'un GPT-4. Pour ces cas, il faut du GPU — et nous préférons vous le dire avant que vous ne l'appreniez en production.

Notre recommandation

Un Quantum avec 64 GB de RAM couvre tous les usages réalistes du moment. Et lancez toujours vos benchmarks avec vos propres prompts : la longueur du contexte influence la vitesse autant que la taille du modèle.