jules lassoeur
Lab / 01 · 12-2025

Cloud-GPU

Un ChatGPT maison qui n'allume un GPU que quand il en faut un. Les petits modèles tournent en local, les gros se louent à la minute.

§01L'idée

Un H100 coûte jusqu'à 4 $ de l'heure. Le laisser tourner pour rien est absurde. L'orchestrateur relie mes machines (un Mac et une tour avec Ollama, des GPU cloud) dans un même réseau privé, et décide où va chaque requête : local si c'est gratuit, cloud si c'est nécessaire, et extinction automatique dès que ça se calme.

§02Comment ça marche

join

Brancher

Un wizard installe Tailscale + Ollama et raccorde n'importe quelle machine au réseau.

route

Router

Requête sur un petit modèle → une machine locale répond. Coût : zéro.

scale

Allumer

Gros modèle demandé → location du bon GPU (~2 min), facturé à la minute.

sleep

Éteindre

5 minutes sans requête → le GPU s'éteint tout seul. Zéro coût au repos.

§03L'architecture

Trois étages, et le voyage d'une requête, étape par étape.

vous
Navigateur
téléphone ou PC, une interface type ChatGPT, accessible en HTTPS de n'importe où.
↓ https
le chef d'orchestre, un VPS à 4 €/mois
Traefik
la porte d'entrée : SSL auto, route chaque appel vers le bon service.
Orchestrateur
le cerveau : sait quels workers vivent, alloue les GPU, les éteint.
OpenWebUI
l'interface de chat, branchée sur une API compatible OpenAI.
↓ tailscale, le réseau privé entre toutes les machines
les muscles
Mac & tour · Ollama
toujours allumés, petits modèles, 0 $/h. N'importe qui peut brancher sa machine au réseau.
GPU cloud · vLLM
loué à la demande chez RunPod, gros modèles, facturé à la minute.
← retour au lab