Systemanforderungen¶
Was der Server und die GPU-Maschinen brauchen, bevor Sie etwas installieren. Die Größe des Servers richtet sich nach den Diensten, die er ausführt, und nach den Personen, die sie nutzen; die Größe einer GPU-Maschine nach den Modellen, die sie ausführt.
Der Server¶
| Minimum | Empfohlen | |
|---|---|---|
| Betriebssystem | Linux, x86_64 | |
| CPU-Kerne | 4 | 8 |
| Arbeitsspeicher, Kerndienste | 6 GB | 8 GB |
| Arbeitsspeicher, mit den Modulen PII, MCP und Skills | 8 GB | 12 GB |
| Speicherplatz | 60 GB | 100 GB, zuzüglich der Größe der Modelle, die Sie bereitstellen wollen |
| GPU | keine | keine |
- Docker Engine 24 oder neuer mit Compose v2. Der Benutzer, der
fadenausführt, muss Docker verwenden dürfen (also in der Gruppedockersein). - Python 3.12 oder neuer, mit
pipxoderuv, um das Kommandozeilenwerkzeugfadenzu installieren. - Ports 80 und 443 frei auf dem Server. Andere Ports lassen sich wählen; siehe Netzwerk und Ports.
- Internetzugang während Installation und Upgrade, um die Images der Dienste und die Runtime-Images herunterzuladen. Siehe Was einen Internetzugang braucht.
Rechnen Sie Arbeitsspeicher für alles hinzu, was sonst noch auf dem Server läuft. Der Server braucht keine GPU: Die Modelle laufen auf den Maschinen, die Sie hinzufügen. Einen Server mit NVIDIA-GPU können Sie zusätzlich als Maschine hinzufügen.
faden doctor prüft einen Host vor der Installation: Arbeitsspeicher, freien Speicherplatz, Docker, Compose und
ob die Ports frei sind, die die Installation nach außen öffnet.
Was womit wächst¶
| Wenn Sie hinzufügen | Was auf dem Server wächst |
|---|---|
| Personen, die gleichzeitig chatten | Zuerst die CPU-Last des Gateways und der Konsolen-API, dann die Datenbankverbindungen |
| Das PII-Modul | Etwa 2 GB Arbeitsspeicher (es lädt ein Sprachmodell), mehr CPU pro Chat-Runde |
| MCP-Tools, Skills | Einige hundert MB Arbeitsspeicher |
| Modelle | Speicherplatz: Jedes Modell wird auf den Server heruntergeladen und von dort auf die Maschinen kopiert |
| GPU-Maschinen | Ein Runtime-Image pro Maschinenart auf der Festplatte; bei CPU und Arbeitsspeicher nichts Messbares |
| Tracing | Speicherplatz für den Trace-Speicher |
faden deploy und faden upgrade bemessen die Dienste für den Host, auf dem sie laufen: wie viele
Worker-Prozesse jeder Dienst bekommt und wie viele Datenbankverbindungen Postgres annimmt. Um sie nach einer
Änderung der Hardware neu zu bemessen, führen Sie faden tune und danach faden up aus.
Speicherplatz¶
| Was | Größe | Nötig |
|---|---|---|
| Images der Dienste | etwa 11 GB | immer |
| Runtime-Image, x86_64-Maschinen | etwa 15 GB | wenn Sie x86_64-GPU-Maschinen hinzufügen |
| Runtime-Image, Maschinen vom Typ NVIDIA DGX Spark | etwa 12 GB | wenn Sie DGX-Spark-Maschinen hinzufügen |
| Modellspeicher | die Modelle, die Sie bereitstellen | immer |
| Datenbank | wächst mit dem Chatverlauf | immer |
| Trace-Speicher | wächst mit den Traces | wenn Tracing eingeschaltet ist |
Der Server hält für jede Maschinenart, die Sie haben, ein Runtime-Image vor, weil die Maschinen es vom Server
herunterladen, nicht aus dem Internet. Wenn Sie nur x86_64-Maschinen haben, installieren Sie mit
faden deploy --runtime-images x86_64, um das andere auszulassen.
Sicherungen landen standardmäßig auf derselben Festplatte; lassen Sie Platz dafür, oder legen Sie sie woanders ab (siehe Sicherungen).
GPU-Maschinen¶
| Betriebssystem | Linux: x86_64, oder aarch64 nur auf NVIDIA DGX Spark |
| GPU | Nur NVIDIA, mit funktionierendem Treiber: nvidia-smi muss Ihre Karte anzeigen |
| Container | Docker oder Podman, laufend und nutzbar für den Benutzer, unter dem der Agent läuft, mit Zugriff auf die GPU (bei Docker: das NVIDIA Container Toolkit) |
| Dienstverwaltung | systemd: Der Agent läuft als Systemdienst oder, wenn er ohne sudo installiert wurde, als Benutzerdienst |
| Speicherplatz | Etwa 15 GB für das Runtime-Image plus Platz für die Modelle, die die Maschine ausführt; ein Wechsel der Runtime braucht, solange er läuft, Platz für ein zweites Image |
| Netzwerk | Die Maschine muss den HTTPS-Port des Servers erreichen. Der Server muss den Modell-Port der Maschine erreichen. Maschinen in einem Cluster müssen einander erreichen. Siehe Netzwerk und Ports |
Zwei Maschinenarten werden unterstützt, jede mit eigenem Runtime-Image:
- x86_64-Maschinen mit NVIDIA-GPUs, von der Turing-Generation bis Blackwell. Ihr Runtime-Image ist noch nicht zertifiziert: Die Karte Laufzeit des Clusters zeigt Nicht zertifiziert.
- NVIDIA DGX Spark (GB10, aarch64).
Andere Maschinen werden nicht unterstützt. Eine Maschine ohne NVIDIA-GPU oder mit einer anderen Prozessorarchitektur kann beitreten, aber keinem Cluster zugeordnet werden: Der Cluster-Assistent meldet, dass kein zertifiziertes Runtime-Image auf ihr läuft. Einer anderen aarch64-Maschine mit NVIDIA-GPU wird das Image für DGX Spark angeboten, das nicht für sie gemacht ist.
Hinweis
Ein Modell läuft jeweils auf einer GPU-Art. Gemischte Maschinen können sich einen Cluster teilen, aber jede Kopie eines Modells landet auf Maschinen einer Art. Maschinen, die gemeinsam ein Modell ausführen sollen, brauchen dieselben GPUs.
Der GPU-Speicher entscheidet, welche Modelle passen. Der Modell-Marktplatz zeigt für jedes Modell und jeden Cluster, ob es auf einen Teil eines Beschleunigers passt, auf einen ganzen, verteilt auf mehrere oder gar nicht (siehe Modelle).
Was einen Internetzugang braucht¶
| Wer | Erreicht | Wann |
|---|---|---|
| Server | Container-Registries (ghcr.io, Docker Hub und die anderen, aus denen die Images stammen) |
bei Installation und Upgrade |
| Server | Hugging Face | beim Herunterladen von Modellen |
| Server | Externe Modell-Provider, externe MCP-Server | wenn der Administrator welche anbindet |
| Server | GitHub | um seine eigene Kopie der Agent-Builds zu prüfen, falls er eine vorhält |
| GPU-Maschinen | GitHub (die Releases des Projekts) | beim Installieren oder Aktualisieren des Agenten, sofern der Server die Agent-Builds nicht vorhält |
| GPU-Maschinen | Hugging Face | nur in einem Cluster, der so eingestellt ist, dass seine Maschinen Modelle selbst herunterladen |
Alles andere, was eine Maschine braucht – das Runtime-Image und die Modelle –, kommt vom Server. Eine Maschine ohne Internetzugang funktioniert, solange der Server die Agent-Builds vorhält; siehe Maschinen ohne Internetzugang.