Skip to content

KI-gestützte Funktionen

Installation eines selbst gehosteten Ollama-Servers

Section titled “Installation eines selbst gehosteten Ollama-Servers”

Diese Anleitung beschreibt die Einrichtung von Ollama auf einem selbst gehosteten Windows-Server. Alternativ kann Ollama auch auf einem Linux-Server betrieben werden.

Für eine deutlich schnellere Verarbeitung kann Ollama eine geeignete Grafikkarte (GPU) verwenden. Der Betrieb ist jedoch auch auf einem normalen Server ohne GPU möglich. In diesem Fall erfolgt die Verarbeitung über die CPU und benötigt entsprechend mehr Zeit.

  1. Ollama herunterladen

    Laden Sie die aktuelle Version der Datei ollama-windows-amd64.zip von GitHub herunter:

    Ollama Server Download

    Eine alternative Version finden Sie im WWS MaX Downloadverzeichnis unter Tools.

  2. Ollama entpacken

    Entpacken Sie die Datei in ein Verzeichnis Ihrer Wahl, zum Beispiel:

    C:\Ollama
  3. Berechtigungen festlegen

    Stellen Sie sicher, dass der Ollama-Dienst auf das Installationsverzeichnis und das darin enthaltene Modellverzeichnis zugreifen kann.

    Bei Verwendung des standardmäßig von NSSM verwendeten Kontos LocalSystem genügen beispielsweise folgende Berechtigungen:

    • SYSTEM: Lesen und Schreiben
    • Administratoren: Lesen und Schreiben

    Nicht benötigte Zugriffsberechtigungen können entfernt werden.

  4. NSSM herunterladen

    Laden Sie den NSSM (Non-Sucking Service Manager) von NSSM.cc oder aus dem WWS MaX Downloadverzeichnis herunter.

  5. NSSM installieren

    Entpacken Sie die Datei nssm.exe aus dem Verzeichnis win64 in das Ollama-Verzeichnis.

  6. Ollama als Windows-Dienst installieren

    Führen Sie die folgenden Befehle in einer Eingabeaufforderung (CMD) als Administrator aus.

    Passen Sie den Pfad entsprechend an, falls Sie Ollama in einem anderen Verzeichnis installiert haben.

    Terminal window
    C:\Ollama\nssm.exe install Ollama "C:\Ollama\ollama.exe" serve
    C:\Ollama\nssm.exe set Ollama AppEnvironmentExtra ^
    OLLAMA_MODELS=C:\Ollama\Models ^
    OLLAMA_HOST=0.0.0.0:11434 ^
    OLLAMA_NO_CLOUD=1
    C:\Ollama\nssm.exe set Ollama Start SERVICE_AUTO_START
    C:\Ollama\nssm.exe start Ollama

    Die verwendeten Einstellungen haben folgende Bedeutung:

    EinstellungBedeutung
    OLLAMA_MODELSVerzeichnis, in dem die heruntergeladenen Modelle gespeichert werden
    OLLAMA_HOSTNetzwerkadresse und Port, auf denen der Ollama-Server erreichbar ist
    OLLAMA_NO_CLOUD=1Deaktiviert die Ollama-Cloud-Funktionen und erzwingt einen lokalen Betrieb
  7. Windows-Firewall konfigurieren

    Öffnen Sie den TCP-Port 11434 für eingehende Verbindungen aus dem lokalen Netzwerk.

    Führen Sie dazu folgenden Befehl in PowerShell als Administrator aus:

    Terminal window
    New-NetFirewallRule `
    -DisplayName "Ollama API" `
    -Direction Inbound `
    -Protocol TCP `
    -LocalPort 11434 `
    -RemoteAddress LocalSubnet `
    -Action Allow
  8. Ollama-Server überprüfen

    Prüfen Sie zunächst, ob der Ollama-Server erreichbar ist.

    Öffnen Sie dazu auf dem Server beispielsweise folgende Adresse im Browser:

    http://localhost:11434

    Bei einem erfolgreich gestarteten Server sollte eine entsprechende Bestätigung von Ollama angezeigt werden.

    Alternativ können Sie die Versionsinformationen über die API abrufen:

    http://localhost:11434/api/version
  9. KI-Modelle herunterladen

    Laden Sie anschließend die Modelle herunter, die von WWS MaX verwendet werden sollen.

    Welche Modelle sinnvoll sind, hängt unter anderem von der verfügbaren Rechenleistung, dem Arbeitsspeicher und der gewünschten Verarbeitungsgeschwindigkeit ab.

    Für die Generierung von Embeddings kann beispielsweise qwen3-embedding:4b verwendet werden.

    Ollama-ModellModellgrößeRichtwert RAM bei CPU-Betrieb
    qwen3-embedding:4b-q4_K_M2,5 GBca. 4–6 GB
    qwen3-embedding:4b-q8_04,3 GBca. 6–8 GB
    qwen3-embedding:4b-fp168,0 GBca. 10–12 GB

    Für die meisten Installationen ist qwen3-embedding:4b-q4_K_M ein guter Kompromiss zwischen Speicherbedarf, Geschwindigkeit und Qualität.

    Modelle für Dokumentzusammenfassung und weitere KI-Funktionen

    Section titled “Modelle für Dokumentzusammenfassung und weitere KI-Funktionen”

    Für Dokumentzusammenfassungen, Kategorisierung und andere generative KI-Funktionen können beispielsweise folgende Modelle verwendet werden:

    Ollama-ModellQuantisierungModellgrößeRichtwert RAM bei CPU-Betrieb
    qwen3.5:9bQ4_K_M6,6 GBca. 8–12 GB
    qwen3.5:27bQ4_K_M17 GBca. 20–28 GB

    qwen3.5:9b benötigt deutlich weniger Arbeitsspeicher und verarbeitet Dokumente auf CPU-basierten Servern wesentlich schneller.

    qwen3.5:27b benötigt mehr Arbeitsspeicher und Rechenleistung, kann dafür bei anspruchsvolleren Dokumenten und Aufgaben eine höhere Ergebnisqualität liefern.

    Ein Modell kann beispielsweise mit folgendem Befehl heruntergeladen werden:

    Terminal window
    C:\Ollama\ollama.exe pull qwen3.5:9b

    Für das Embedding-Modell:

    Terminal window
    C:\Ollama\ollama.exe pull qwen3-embedding:4b-q4_K_M

    Eine Liste aller bereits installierten Modelle erhalten Sie mit:

    Terminal window
    C:\Ollama\ollama.exe list
  10. KI-Modell testen

    Ein installiertes Sprachmodell kann direkt über die Ollama-Kommandozeile getestet werden:

    Terminal window
    C:\Ollama\ollama.exe run qwen3.5:9b

    Geben Sie anschließend beispielsweise eine einfache Anfrage ein:

    Fasse folgenden Text in einem Satz zusammen: ...

    Mit dem Befehl

    Terminal window
    C:\Ollama\ollama.exe ps

    können Sie zusätzlich überprüfen, welche Modelle aktuell geladen sind und ob diese über CPU oder GPU ausgeführt werden.