Cloud-GPU
Un ChatGPT maison qui n'allume un GPU que quand il en faut un. Les petits modèles tournent en local, les gros se louent à la minute.
§01L'idée
Un H100 coûte jusqu'à 4 $ de l'heure. Le laisser tourner pour rien est absurde. L'orchestrateur relie mes machines (un Mac et une tour avec Ollama, des GPU cloud) dans un même réseau privé, et décide où va chaque requête : local si c'est gratuit, cloud si c'est nécessaire, et extinction automatique dès que ça se calme.
§02Comment ça marche
join
Brancher
Un wizard installe Tailscale + Ollama et raccorde n'importe quelle machine au réseau.
route
Router
Requête sur un petit modèle → une machine locale répond. Coût : zéro.
scale
Allumer
Gros modèle demandé → location du bon GPU (~2 min), facturé à la minute.
sleep
Éteindre
5 minutes sans requête → le GPU s'éteint tout seul. Zéro coût au repos.
§03L'architecture
Trois étages, et le voyage d'une requête, étape par étape.
vous
Navigateur
téléphone ou PC, une interface type ChatGPT, accessible en HTTPS de n'importe où.
↓ https
le chef d'orchestre, un VPS à 4 €/mois
Traefik
la porte d'entrée : SSL auto, route chaque appel vers le bon service.
Orchestrateur
le cerveau : sait quels workers vivent, alloue les GPU, les éteint.
OpenWebUI
l'interface de chat, branchée sur une API compatible OpenAI.
↓ tailscale, le réseau privé entre toutes les machines
les muscles
Mac & tour · Ollama
toujours allumés, petits modèles, 0 $/h. N'importe qui peut brancher sa machine au réseau.
GPU cloud · vLLM
loué à la demande chez RunPod, gros modèles, facturé à la minute.