Zum Inhalt

Nutzung und Kosten

Fadenstack zählt jede Anfrage, die durch sein Gateway geht: wer sie gesendet hat, welches Modell geantwortet hat und wo es lief, wie viele Tokens sie verbraucht hat, wie lange sie gedauert hat und was sie zu den von Ihnen festgelegten Preisen kosten würde. Diese Seite zeigt, wo Sie diese Zahlen finden und wie die Kostenschätzungen aussagekräftig werden.

Was gezählt wird

Für jede Anfrage hält das Anfrageprotokoll fest:

  • den Benutzer, seine Nutzungsgruppe und das Chat-Projekt oder den Agenten, von dem sie kam;
  • das Modell und wo es lief: auf Ihren Maschinen, in Ihrem Netz oder bei einem externen Provider;
  • die Tokens: Eingabe, Ausgabe und gesamt;
  • die Zeit bis zum ersten Token und die Gesamtdauer;
  • das Ergebnis: Erfolg oder den Fehler;
  • die geschätzten Kosten, wenn das Modell einen Preis hat.

Der Text der Anfrage und ihrer Antwort gehört nicht dazu. Alles, was durch das Gateway geht, wird gezählt: der Chat, die Agenten und Anwendungen, die API-Tokens nutzen.

Wo Sie es sehen

Wo Was es zeigt
Dashboard Den heutigen Tag auf einen Blick: Anfragen heute, Aktive Benutzer heute, Intern bearbeitet, Kosten diesen Monat, Fehlerquote (1 Std.); KI-Datenverkehr (wo Anfragen bedient wurden) und Nutzung (Anfragen pro Tag, nach Ort der Bearbeitung).
Observability → Kosten-Dashboard Die Kosten- und Nutzungsseiten (siehe unten).
Der Reiter Aktivität eines Agenten Anfragen, Fehler, Tokens, Benutzer und Unterhaltungen dieses Agenten, nur als Zahlen (siehe Agenten und Add-ins).
Die Seite einer Bereitstellung Anfragen, Geschwindigkeit und Fehler dieses Modells in den letzten Minuten (siehe Bereitstellungen).
Observability → Datenresidenz Wie viele Daten an Ihre Maschinen, in Ihr Netz und nach außen gingen (siehe Datenresidenz).

Die Kosten- und Nutzungsseiten

Öffnen Sie Observability → Kosten-Dashboard (die Seite heißt Kosten-Observability) und wählen Sie einen Zeitraum.

Kosten-Observability, geöffnet über Observability → Kosten-Dashboard: die Reiter Übersicht, Anfragen und Preise sowie die Zeiträume 7d bis 90d mit Aktualisieren und Herunterladen oben rechts

  • Übersicht: Geschätzte Ausgaben, Anfragen gesamt, Tokens gesamt, Durchschn. Latenz und Fehlerrate, dazu Kosten im Zeitverlauf, Anfrage-Durchsatz, Latenz-Perzentile, Ausgaben nach Modell und Top-Benutzer.
  • Anfragen: jede Anfrage, die neueste zuerst. Filtern Sie nach Modell oder Benutzer-ID und öffnen Sie eine Anfrage, um ihre Details zu sehen: Tokens, Kosten, Zeiten, die Tools und Skills, die sie genutzt hat, und die Schritte, die sie durchlaufen hat.
  • Preise: die Preise, mit denen die Schätzungen rechnen (siehe unten).
  • CSV exportieren lädt die Anfragen des Zeitraums (bis zu 5.000 Zeilen) für eine Tabellenkalkulation herunter.

Preise festlegen

Kosten sind Schätzungen auf Grundlage der Preise, die Sie pro Modell festlegen. Sie ändern nichts an dem, was ein Provider Ihnen in Rechnung stellt.

  1. Öffnen Sie LLM → Provider und wählen Sie in der Zeile des Modells Preis festlegen (in der Spalte Preis $/1 Mio.).
  2. Geben Sie ein, was eine Million Eingabe-Tokens und eine Million Ausgabe-Tokens kosten.

    Der Preisdialog für ein Modell: Eingabepreis und Ausgabepreis in USD pro Million Tokens, und Speichern

  3. Speichern Sie. Anfragen werden innerhalb einer Minute mit diesem Preis berechnet.

Sie können Preise auch festlegen, wenn Sie einen Provider anbinden, oder unter Preise auf den Kostenseiten, wo der Preisverlauf jedes Modells aufbewahrt wird. Verwenden Sie für ein Cloud-Modell die Listenpreise des Providers. Für Ihre eigenen Modelle können Sie mit einem eigenen Preis (z. B. dem, was Sie die Hardware pro Million Tokens kostet) die interne Nutzung vergleichen und intern verrechnen; lassen Sie das Feld leer, wenn Sie das nicht brauchen.

Der Reiter Preise der Kostenseiten: Eingabe- und Ausgabepreis jedes Modells pro Million Tokens, ob es ein Standardwert ist oder von einem Administrator festgelegt wurde, ab wann er gilt, und Preis hinzufügen

Anfragen an ein externes Modell ohne Preis werden trotzdem gezählt. Kosten diesen Monat auf dem Dashboard zeigt, wie viele es waren („Anfragen ohne Preis“), damit Sie wissen, dass die Schätzung zu niedrig ist.

Nutzung pro Person und pro Gruppe

  • Pro Person: Top-Benutzer auf den Kostenseiten und der Filter Benutzer-ID unter Anfragen.
  • Pro Gruppe: Jede Anfrage wird mit der Nutzungsgruppe des Benutzers erfasst, also der Gruppe, die in seiner Zeile unter Zugriffskontrolle → Benutzer eingestellt ist (siehe Benutzer, Gruppen und Rollen). Ein Benutzer ohne Nutzungsgruppe zählt zu keiner. Berichte über die Nutzung pro Gruppe in der Konsole sind Geplant.

Limits und Budgets

Budgets und Limits pro Person, Gruppe oder Agent sind Geplant: Sie werden begrenzen, wie viel eine Person, ein Team oder ein Agent nutzen darf.

Wenn es nicht funktioniert

Die Zahlen sind leer. Im Zeitraum gibt es keine Anfragen, oder das Gateway kann sein Protokoll nicht schreiben. Senden Sie eine Nachricht im Chat und aktualisieren Sie dann die Seite.

Die Kosten zeigen „Keine“ oder wirken zu niedrig. Die verwendeten Modelle haben keinen Preis. Legen Sie ihn wie oben beschrieben fest.

Eine Anfrage fehlt auf den Kostenseiten. Gezählt werden nur Anfragen, die das Gateway erreichen: Ein Modell, das jemand direkt an seinem Endpunkt aufruft, an Fadenstack vorbei, wird nicht gezählt.