KI-gestützte Funktionen
Installation eines selbst gehosteten Ollama-Servers
Section titled “Installation eines selbst gehosteten Ollama-Servers”Diese Anleitung beschreibt die Einrichtung von Ollama auf einem selbst gehosteten Windows-Server. Alternativ kann Ollama auch auf einem Linux-Server betrieben werden.
Für eine deutlich schnellere Verarbeitung kann Ollama eine geeignete Grafikkarte (GPU) verwenden. Der Betrieb ist jedoch auch auf einem normalen Server ohne GPU möglich. In diesem Fall erfolgt die Verarbeitung über die CPU und benötigt entsprechend mehr Zeit.
-
Ollama herunterladen
Laden Sie die aktuelle Version der Datei
ollama-windows-amd64.zipvon GitHub herunter:Eine alternative Version finden Sie im WWS MaX Downloadverzeichnis unter
Tools. -
Ollama entpacken
Entpacken Sie die Datei in ein Verzeichnis Ihrer Wahl, zum Beispiel:
C:\Ollama -
Berechtigungen festlegen
Stellen Sie sicher, dass der Ollama-Dienst auf das Installationsverzeichnis und das darin enthaltene Modellverzeichnis zugreifen kann.
Bei Verwendung des standardmäßig von NSSM verwendeten Kontos
LocalSystemgenügen beispielsweise folgende Berechtigungen:SYSTEM: Lesen und SchreibenAdministratoren: Lesen und Schreiben
Nicht benötigte Zugriffsberechtigungen können entfernt werden.
-
NSSM herunterladen
Laden Sie den NSSM (Non-Sucking Service Manager) von NSSM.cc oder aus dem WWS MaX Downloadverzeichnis herunter.
-
NSSM installieren
Entpacken Sie die Datei
nssm.exeaus dem Verzeichniswin64in das Ollama-Verzeichnis. -
Ollama als Windows-Dienst installieren
Führen Sie die folgenden Befehle in einer Eingabeaufforderung (CMD) als Administrator aus.
Passen Sie den Pfad entsprechend an, falls Sie Ollama in einem anderen Verzeichnis installiert haben.
Terminal window C:\Ollama\nssm.exe install Ollama "C:\Ollama\ollama.exe" serveC:\Ollama\nssm.exe set Ollama AppEnvironmentExtra ^OLLAMA_MODELS=C:\Ollama\Models ^OLLAMA_HOST=0.0.0.0:11434 ^OLLAMA_NO_CLOUD=1C:\Ollama\nssm.exe set Ollama Start SERVICE_AUTO_STARTC:\Ollama\nssm.exe start OllamaDie verwendeten Einstellungen haben folgende Bedeutung:
Einstellung Bedeutung OLLAMA_MODELSVerzeichnis, in dem die heruntergeladenen Modelle gespeichert werden OLLAMA_HOSTNetzwerkadresse und Port, auf denen der Ollama-Server erreichbar ist OLLAMA_NO_CLOUD=1Deaktiviert die Ollama-Cloud-Funktionen und erzwingt einen lokalen Betrieb -
Windows-Firewall konfigurieren
Öffnen Sie den TCP-Port
11434für eingehende Verbindungen aus dem lokalen Netzwerk.Führen Sie dazu folgenden Befehl in PowerShell als Administrator aus:
Terminal window New-NetFirewallRule `-DisplayName "Ollama API" `-Direction Inbound `-Protocol TCP `-LocalPort 11434 `-RemoteAddress LocalSubnet `-Action Allow -
Ollama-Server überprüfen
Prüfen Sie zunächst, ob der Ollama-Server erreichbar ist.
Öffnen Sie dazu auf dem Server beispielsweise folgende Adresse im Browser:
http://localhost:11434Bei einem erfolgreich gestarteten Server sollte eine entsprechende Bestätigung von Ollama angezeigt werden.
Alternativ können Sie die Versionsinformationen über die API abrufen:
http://localhost:11434/api/version -
KI-Modelle herunterladen
Laden Sie anschließend die Modelle herunter, die von WWS MaX verwendet werden sollen.
Welche Modelle sinnvoll sind, hängt unter anderem von der verfügbaren Rechenleistung, dem Arbeitsspeicher und der gewünschten Verarbeitungsgeschwindigkeit ab.
Modelle für die semantische Suche
Section titled “Modelle für die semantische Suche”Für die Generierung von Embeddings kann beispielsweise
qwen3-embedding:4bverwendet werden.Ollama-Modell Modellgröße Richtwert RAM bei CPU-Betrieb qwen3-embedding:4b-q4_K_M2,5 GB ca. 4–6 GB qwen3-embedding:4b-q8_04,3 GB ca. 6–8 GB qwen3-embedding:4b-fp168,0 GB ca. 10–12 GB Für die meisten Installationen ist
qwen3-embedding:4b-q4_K_Mein guter Kompromiss zwischen Speicherbedarf, Geschwindigkeit und Qualität.Modelle für Dokumentzusammenfassung und weitere KI-Funktionen
Section titled “Modelle für Dokumentzusammenfassung und weitere KI-Funktionen”Für Dokumentzusammenfassungen, Kategorisierung und andere generative KI-Funktionen können beispielsweise folgende Modelle verwendet werden:
Ollama-Modell Quantisierung Modellgröße Richtwert RAM bei CPU-Betrieb qwen3.5:9bQ4_K_M 6,6 GB ca. 8–12 GB qwen3.5:27bQ4_K_M 17 GB ca. 20–28 GB qwen3.5:9bbenötigt deutlich weniger Arbeitsspeicher und verarbeitet Dokumente auf CPU-basierten Servern wesentlich schneller.qwen3.5:27bbenötigt mehr Arbeitsspeicher und Rechenleistung, kann dafür bei anspruchsvolleren Dokumenten und Aufgaben eine höhere Ergebnisqualität liefern.Ein Modell kann beispielsweise mit folgendem Befehl heruntergeladen werden:
Terminal window C:\Ollama\ollama.exe pull qwen3.5:9bFür das Embedding-Modell:
Terminal window C:\Ollama\ollama.exe pull qwen3-embedding:4b-q4_K_MEine Liste aller bereits installierten Modelle erhalten Sie mit:
Terminal window C:\Ollama\ollama.exe list -
KI-Modell testen
Ein installiertes Sprachmodell kann direkt über die Ollama-Kommandozeile getestet werden:
Terminal window C:\Ollama\ollama.exe run qwen3.5:9bGeben Sie anschließend beispielsweise eine einfache Anfrage ein:
Fasse folgenden Text in einem Satz zusammen: ...Mit dem Befehl
Terminal window C:\Ollama\ollama.exe pskönnen Sie zusätzlich überprüfen, welche Modelle aktuell geladen sind und ob diese über CPU oder GPU ausgeführt werden.