Lokale NSFW-KI-Chatbots: unzensiertes Rollenspiel auf deinem eigenen PC
Von der Redaktion von AI NSFW Bots, aktualisiert am
So läuft unzensiertes KI-Rollenspiel auf deinem eigenen Rechner: VRAM nach Modellgröße, KoboldCpp, Ollama oder LM Studio mit SillyTavern, Modelle, Einstellungen und Datenschutz.
Einen NSFW-KI-Chatbot lokal zu betreiben heißt, dass das Sprachmodell auf deinem eigenen Computer läuft statt auf den Servern einer Firma: kein Konto, kein Plattformfilter, kein Abo, und deine Chats bleiben auf deiner Festplatte. Das eignet sich für Erwachsene mit einem leistungsfähigen Gaming-PC oder einem aktuellen Mac, die ein bisschen Einrichtung nicht scheuen. Du brauchst eine Grafikkarte mit mindestens 8 GB VRAM (12 GB oder mehr sind besser) oder einen Mac mit Apple Silicon und 16 GB oder mehr gemeinsamem Arbeitsspeicher. Für Einsteiger: KoboldCpp und SillyTavern mit einem Rollenspielmodell der 12B-Klasse in Q4_K_M, oder ein Modell mit 7 bis 9B auf einer 8-GB-Karte.
Partner-Tipps
So bewerten wirAffiliate-Link. Stand: Sept. 2026. Links beeinflussen nie die Wertung.
Warum einen NSFW-Chatbot lokal betreiben
- Datenschutz. Nachrichten gehen von SillyTavern an ein Programm auf demselben Computer und nirgendwo sonst hin, es sei denn, du bindest einen Cloud-Dienst an.
- Kein Plattformfilter. Gehostete Plattformen legen ihre eigenen Inhaltsregeln fest und ändern sie. Lokal gibt es nur die Grenzen, die dem gewählten Modell antrainiert wurden.
- Kein Abo, keine Nachrichtenlimits. Software und Modelle sind kostenlos; du zahlst für Hardware und Strom.
- Offline-Nutzung, sobald alles heruntergeladen ist.
Die Nachteile:
- Hardwarekosten. Für ein gutes Erlebnis brauchst du 12 GB VRAM oder mehr, oder einen Mac mit 32 GB für mittelgroße Modelle; die Anschaffung kostet mehr als viele Monate eines gehosteten Abos.
- Einrichtungszeit. Zwei Programme, ein Download von mehreren Gigabyte und eine Handvoll Einstellungen, auf die es ankommt, dazu Updates.
- Kleinere Modelle schreiben schlechter. Ein Modell, das auf eine Gaming-GPU passt, ist viel kleiner als die größten gehosteten Modelle: Rechne mit mehr Wiederholungen, schwächerem Gedächtnis und mehr Lenkung durch dich.
- Keine Bilder und keine Stimme ab Werk. KoboldCpp kann Bild- und Sprachmodelle laden, und SillyTavern hat Erweiterungen für beides, aber jedes davon braucht eigene Downloads und eigenen Speicher.
Hardware: Wie viel Speicher du brauchst
Das Modell muss in schnellen Speicher passen: den VRAM deiner Grafikkarte oder den gemeinsamen Arbeitsspeicher eines Macs mit Apple Silicon. Die Tabelle zeigt grobe Schätzungen, keine Messungen, für Q4_K_M (die verbreitete 4-Bit-Quantisierung, weiter unten erklärt) mit einer Kontextgröße, die bequem hineinpasst; im echten Einsatz variiert das je nach Modell und Backend.
| Modellgröße | GPU-VRAM | Mac-Speicher | Kontext | Gut für |
|---|---|---|---|---|
| 7 bis 9B | 8 GB | 16 GB | 8K bis 16K | Schnelle Antworten auf bescheidenen GPUs; verliert früher den Faden |
| 12 bis 14B | 12 GB | 16 bis 24 GB | 8K bis 16K | Beliebter Kompromiss aus Qualität und Tempo |
| 22 bis 27B | 24 GB (16 GB mit kleinerer Quantisierung) | 32 GB | 16K bis 32K | Beständigere Charaktere, bessere Prosa |
| 30 bis 32B | 24 GB | 36 bis 48 GB | 8K bis 16K | Bessere Szenenlogik; füllt eine 24-GB-Karte |
| 70B | 48 GB (zwei Karten) | 64 GB oder mehr | 8K bis 16K | Die stärksten Texte in dieser Liste; braucht große Hardware |
Schnelltest für jedes Modell: Die Größe der GGUF-Datei plus 2 bis 5 GB für Kontext und Rechenpuffer sollte in deinen VRAM passen. Zur Orientierung: 12 GB haben etwa die RTX 3060 12 GB, 4070 und 5070; 16 GB die RTX 4060 Ti 16 GB, 4080 und 5080; 24 GB die RTX 3090 und 4090. Laptop-GPUs haben oft weniger VRAM als die gleichnamige Desktop-Karte; der Task-Manager zeigt deinen Wert unter Leistung, GPU.
NVIDIA-Karten sind am einfachsten, weil jedes Tool CUDA unterstützt. AMD- und Intel-Karten laufen über Vulkan (bei AMD auch über ROCm), mit mehr Einrichtungsaufwand und oft geringerem Tempo.
VRAM, Arbeitsspeicher und Offloading
Passt ein Modell nicht in den VRAM, können KoboldCpp, Ollama und LM Studio einen Teil davon im Arbeitsspeicher halten und diesen Teil auf der CPU rechnen lassen. Das funktioniert, aber der Arbeitsspeicher ist viel langsamer: Ein paar Layer dort kosten etwas Tempo, das halbe Modell kann die Antworten um ein Mehrfaches verlangsamen. Plane 32 GB RAM ein, wenn du auslagern willst.
Mixture-of-Experts-Modelle (MoE) kommen damit besser zurecht. Ein Name wie 35B-A3B bedeutet 35 Milliarden Parameter insgesamt, davon etwa 3 Milliarden aktiv pro Token: Der Speicherbedarf richtet sich nach der Gesamtzahl, das Tempo nach dem aktiven Teil, deshalb bleiben diese Modelle auch dann brauchbar, wenn sie teilweise im Arbeitsspeicher liegen.
Apple Silicon und gemeinsamer Arbeitsspeicher
Bei Macs der M-Serie teilen sich CPU und GPU einen einzigen Speicherpool, sodass ein Mac mit 32 oder 64 GB Modelle laden kann, für die du am PC eine teure Grafikkarte bräuchtest. macOS behält einen Teil davon für sich: Rechne damit, dass ungefähr zwei Drittel bis drei Viertel für das Modell verfügbar sind. Das Tempo hängt von der Speicherbandbreite ab, die bei den Pro-, Max- und Ultra-Chips höher ist, und lange Prompts werden langsamer verarbeitet als auf einem vergleichbaren NVIDIA-System. Intel-Macs sind weitgehend auf die CPU beschränkt.
Charaktere, mit denen Nutzer chatten
aiAllureGratisVideoOhne AnmeldungDajade Nogorcourt
Dajade Nogorcourt, 41, Fantasy Inventor. nerdy & adventurous, pouty lips / long flowing hair style.
Gratis chatten ↗
Dream CompanionGratisElise
A confident and efficient grocery store manager expects high standards from her co-worker, creating an unspoken tension in the aisles.
Gratis chatten ↗
Candy.aiGratisVideoFernanda Montoya
Ambitious real estate assistant from Buenos Aires. Working hard to climb the social ladder by charming clients, learning the trade, and finding a…
Gratis chatten ↗
GirlfriendGPTGratis33K ChatsGabriela Hernandez
You are on vacation at a nice resort in the Caribbean.
Gratis chatten ↗Software: ein Backend plus ein Frontend
Das Backend lädt das Modell und erzeugt den Text. Das Frontend ist die Chat-App, die du benutzt: Sie speichert Charaktere, baut jeden Prompt zusammen und schickt ihn an das Backend. SillyTavern ist das Standard-Frontend für Rollenspiel und funktioniert mit jedem der Backends unten.
| Tool | Was es ist | Systeme | Schwierigkeit | Am besten für |
|---|---|---|---|---|
| KoboldCpp | Backend in einer einzigen Datei mit einfacher Chatseite | Windows, Linux, macOS | Einfach | Die erste Einrichtung, vor allem unter Windows |
| Ollama | Modellserver mit einer kleinen App | Windows, macOS, Linux | Einfach | Mac und Linux; schnelle Modell-Downloads |
| LM Studio | Desktop-App: Modellbrowser, Chat, Server | Windows, macOS, Linux | Am einfachsten | Modelle ausprobieren ohne Terminal |
| TextGen (oobabooga) | App mit Weboberfläche und mehreren Engines | Windows, Linux, macOS | Mittel | Bastler, die jede Einstellung wollen |
| llama.cpp-Server | Die Engine, auf der vieles hiervon aufbaut | Windows, Linux, macOS | Fortgeschritten | Kommandozeilen-Nutzer, neueste Funktionen |
| SillyTavern | Rollenspiel-Frontend | Windows, Linux, macOS, Android | Mittel | Charaktere, Lorebooks, Presets |
TextGen ist der neue Name von text-generation-webui, nach seinem Autor oft oobabooga genannt. LM Studio ist für private und berufliche Nutzung kostenlos, aber nicht quelloffen; die anderen sind Open Source. Ollamas eigene Bibliothek enthält vor allem Allzweckmodelle, es kann aber Rollenspiel-Fine-Tunes von Hugging Face laden.
Offizielle Quellen: KoboldCpp unter github.com/LostRuins/koboldcpp, SillyTavern unter github.com/SillyTavern/SillyTavern, Ollama unter ollama.com, LM Studio unter lmstudio.ai, TextGen unter github.com/oobabooga/textgen, llama.cpp unter github.com/ggml-org/llama.cpp und Modelle unter huggingface.co.
Modelle: GGUF-Dateien, Quantisierung und Fine-Tunes
GGUF und Quantisierung
Jedes Backend oben lädt GGUF, das Dateiformat von llama.cpp: eine Datei mit den Gewichten plus Metadaten wie der Chatvorlage. Große Modelle kommen manchmal in nummerierten Teilen; lade den ersten.
Quantisierung speichert jedes Gewicht mit weniger Bits als den ursprünglichen 16 und senkt so den Speicherbedarf, auf Kosten von etwas Qualität:
- Q8_0: etwa 8.5 Bit pro Gewicht, praktisch nicht vom Original zu unterscheiden.
- Q6_K: etwa 6.6 Bit, sehr nah am Original.
- Q5_K_M: etwa 5.7 Bit, ein kleiner Schritt nach unten.
- Q4_K_M: etwa 4.8 Bit, grob 0.6 GB pro Milliarde Parameter. Der übliche Standard: ein moderater Qualitätsverlust für eine große Ersparnis.
- Unter Q4 (Q3_K_M, Q2_K und ähnliche): spürbare Schäden, am schlimmsten bei kleinen Modellen.
Ein größeres Modell in Q4_K_M schreibt meist besser als ein kleineres aus derselben Familie in Q8_0, also investier den Speicher zuerst in die Größe. Namen, die mit IQ beginnen, etwa IQ4_XS, nutzen ein anderes Verfahren: kleiner bei ähnlicher Qualität, manchmal langsamer.
Basisfamilien und Community-Fine-Tunes
Die meisten lokalen Rollenspielmodelle sind Community-Fine-Tunes: offene Basismodelle großer KI-Labore, die mit Fiktion und Rollenspiel weitertrainiert wurden. Zu den Basisfamilien in Modellnamen gehören Llama (Meta), Mistral und Mistral Nemo (Mistral AI), Qwen (Alibaba) und Gemma (Google); viele beliebte Modelle sind Merges aus mehreren Fine-Tunes. Das Etikett „uncensored“ ist nur eine vage Behauptung, dass ein Modell nichts verweigert; „abliterated“ bedeutet, dass die Verweigerungen durch Bearbeiten der Gewichte entfernt wurden.
Ein bestes Modell nennen wir mit Absicht nicht: Fine-Tunes kommen und gehen innerhalb von Wochen. Such auf Hugging Face nach einer Familie und einer Größe, die du betreiben kannst, plus GGUF, sortier nach Trending oder Recently updated und schau, was die Subreddits zu SillyTavern und LocalLLaMA über neue Veröffentlichungen sagen.
So liest du eine Modellkarte
- Basismodell, angegeben auf der Karte oder im Bereich Model tree auf Hugging Face. Es bestimmt weitgehend das Instruct-Template.
- Größe. Die Parameterzahl sagt dir, welche Zeile der Hardware-Tabelle gilt; bei MoE-Modellen nimm die Gesamtzahl.
- Kontextlänge. Viele Fine-Tunes werden schon lange vor dem Maximum des Basismodells schlechter; gute Karten sagen, ab wo.
- Lizenz. Prüf sie und die des Basismodells. Neuere offene Veröffentlichungen von Qwen, Mistral und Gemma stehen unter Apache 2.0; Llama nutzt Metas Community-Lizenz mit einer Acceptable Use Policy.
- Vorgesehener Einsatz und empfohlene Einstellungen, einschließlich Instruct-Template und der Sampler-Werte, die der Autor getestet hat.
- GGUF-Links. Quantisierte Dateien liegen meist in einem eigenen Repository mit GGUF im Namen, verlinkt über den Model tree.
So beurteilst du ein Modell selbst
- Nutz für jedes Modell dieselbe Charakterkarte, dieselbe erste Nachricht und dieselben Einstellungen und ändere nur das Instruct-Template.
- Lass drei bis fünf Antworten auf dieselbe Nachricht erzeugen (in SillyTavern heißen sie Swipes) und vergleiche sie.
- Prüf, ob der Charakter seine Stimme und seine Fakten behält, nicht deine Zeilen schreibt, seine Formulierungen variiert und nie in Assistentensprache abrutscht.
- Mach 30 bis 50 Nachrichten weiter und frag dann nach etwas vom Anfang des Chats.
- Behalte das Modell, das am seltensten patzt.
Einrichtung Schritt für Schritt
Die Menünamen stammen aus der englischen Oberfläche der aktuellen Versionen; falls einer verschoben wurde, schau in die Dokumentation des Projekts.
Weg 1: KoboldCpp und SillyTavern unter Windows
- Lade KoboldCpp von der Releases-Seite auf GitHub herunter: koboldcpp.exe für NVIDIA-Karten, koboldcpp-nocuda.exe für AMD- oder Intel-Grafik.
- Lade einen Rollenspiel-Fine-Tune als GGUF-Datei in Q4_K_M herunter, in einer Größe, die dein VRAM zulässt. Auch der Button HF Search im Launcher findet Modelle.
- Starte koboldcpp.exe. Windows warnt eventuell vor einer unbekannten App, was bei unsignierten Open-Source-Programmen üblich ist.
- Prüf im Tab Quick Launch, ob unter Backend Use CUDA (NVIDIA) oder Use Vulkan (AMD, Intel) steht, klick dann auf Browse neben GGUF Text Model und wähl deine Datei.
- Lass GPU Layers zunächst auf -1 (automatisch). Wenn die Datei mit Luft in deinen VRAM passt, trag die daneben angezeigte Gesamtzahl der Layer ein, damit alle Layer auf die GPU kommen.
- Setz Context Size auf 8192 oder 16384 und klick auf Launch. Wenn das Laden fertig ist, öffnet sich die eigene Chatseite von KoboldCpp unter
http://localhost:5001. - Installiere Node.js (LTS) und Git. Führ in einem Ordner, der dir gehört (nicht unter Programme), in einem Terminal
git clone https://github.com/SillyTavern/SillyTavern -b releaseaus und doppelklick dann im neuen Ordner auf Start.bat. SillyTavern öffnet sich unterhttp://127.0.0.1:8000. - Öffne API Connections (das Stecker-Symbol), stell API auf Text Completion und API Type auf KoboldCpp, trag
http://localhost:5001als API URL ein, setz das Häkchen bei Derive context size from backend und klick auf Connect. - Öffne AI Response Formatting (das A-Symbol), aktiviere Instruct Mode und schalte die Optionen ein, die Kontext- und Instruct-Template aus dem Modell ableiten. Wird das Template nicht erkannt, wähl das, das auf der Modellkarte steht.
Weg 2: Ollama und SillyTavern unter macOS oder Linux
- Installiere Ollama: unter macOS die App von ollama.com (Version 14 oder neuer, Apple Silicon für GPU-Nutzung), unter Linux mit dem Befehl
curl -fsSL https://ollama.com/install.sh | sh. - Hol dir einen Rollenspiel-Fine-Tune von Hugging Face mit
ollama pull hf.co/user/repository:Q4_K_M, mit dem Pfad des Modells; das Tag nach dem Doppelpunkt wählt die Quantisierung. - Lass Ollama laufen (die App, den Linux-Dienst oder
ollama serve); es lauscht aufhttp://127.0.0.1:11434. - Installiere Node.js und Git (auf dem Mac am einfachsten über Homebrew) und führ dann
git clone https://github.com/SillyTavern/SillyTavern -b release,cd SillyTavernund./start.shaus. - Wähl in API Connections Text Completion, API Type Ollama und die API URL
http://127.0.0.1:11434, klick auf Connect und wähl dein Modell unter Ollama Model. - Aktiviere in AI Response Formatting den Instruct Mode und wähl das Template, das auf der Modellkarte steht; die automatische Erkennung funktioniert mit Ollama nicht.
- Stell in AI Response Configuration (das Regler-Symbol) Context (tokens) ein und setz das Häkchen bei Unlocked, um über 8K zu gehen. SillyTavern gibt den Wert mit jeder Anfrage an Ollama weiter.
Weg 3: LM Studio als einzelne App
- Installiere LM Studio von lmstudio.ai. Es läuft auf Macs mit Apple Silicon (macOS 14 oder neuer), Windows-PCs (x64 mit AVX2 oder ARM) und Linux.
- Such im Tab Discover nach einem Rollenspiel-Fine-Tune und lade eine Q4_K_M-Datei herunter; LM Studio markiert, welche Dateien voraussichtlich passen.
- Öffne im Tab Chat den Model Loader, wähl das Modell und stell Kontextlänge und GPU Offload ein.
- Beschreib Charakter und Szenario im System-Prompt und speicher ihn als Preset. Macs können außerdem MLX-Modelle ausführen, ein Apple-spezifisches Format, das schneller sein kann.
- Für Charakterkarten startest du den Server im Tab Developer, verbindest SillyTavern über Text Completion mit API Type Generic (OpenAI-compatible) und der URL
http://127.0.0.1:1234und stellst das Instruct-Template wie bei Weg 2 ein.
Einstellungen, die für Rollenspiel zählen
Kontextlänge
Der Kontext ist das Arbeitsgedächtnis des Modells, gezählt in Tokens; ein Token entspricht ungefähr drei Vierteln eines englischen Wortes, also fassen 8K Tokens etwa 6000 englische Wörter (auf Deutsch sind es eher weniger). System-Prompt, Charakterkarte, Lorebook-Einträge und der jüngste Chatverlauf teilen ihn sich, und SillyTavern wirft die ältesten Nachrichten raus, wenn er voll ist. Mehr Kontext kostet Speicher und Zeit, deshalb ist 8K bis 16K der praktische Bereich; nutz im Backend und in SillyTavern denselben Wert.
Temperatur, Min-P und Top-P
Die Temperatur steuert den Zufall: Höhere Werte bringen abwechslungsreicheren Text und mehr Fehler, niedrigere sichereren, flacheren Text. Min-P verwirft Wörter, die im Verhältnis zur besten Wahl unwahrscheinlich sind (bei 0.05 alles, was weniger als 5 Prozent so wahrscheinlich ist wie die beste Wahl), und hält den Text so auch bei höheren Temperaturen stimmig. Top-P und Top-K sind ältere, gröbere Filter; mit Min-P setzt du Top-P auf 1 und Top-K auf 0, um sie abzuschalten.
Repetition Penalty
Die Repetition Penalty (Wiederholungsstrafe) macht kürzlich verwendete Wörter unwahrscheinlicher. Halt sie niedrig, etwa 1.05 bis 1.1 über die letzten 1000 bis 2000 Tokens (Rep. Pen. Range in SillyTavern); höhere Werte bringen das Modell dazu, Namen und gängige Wörter zu meiden. Mit KoboldCpp, llama.cpp und TextGen bietet SillyTavern außerdem DRY, das gezielt wiederholte Phrasen angeht: Setz den Multiplier auf etwa 0.8, lass die übrigen Standardwerte, wie sie sind, und senk die normale Penalty auf 1.0.
Instruct-Templates
Instruct-trainierte Modelle erwarten Gespräche in bestimmten Markierungen, etwa ChatML oder die Formate von Llama 3, Mistral und Gemma. SillyTavern formatiert den Prompt mit dem Template, das du auswählst, und ein falsches merkt man sofort: Das Modell schreibt deine Zeilen, gibt verirrte Tags aus, schreibt endlos weiter oder verliert die Stimme des Charakters. Die Modellkarte nennt das richtige. Manche neueren Modelle schreiben vor der Antwort einen Reasoning-Block, der Zeit und Tokens kostet; schalte ihn ab, wo das Modell es zulässt.
Ein vernünftiges Start-Preset
Drück in AI Response Configuration auf Neutralize Samplers und stell dann Temperature auf 0.8 bis 1.0, Min P auf 0.05 bis 0.1, Top P auf 1, Top K auf 0 und Repetition Penalty auf 1.05 über 2048 Tokens (oder DRY auf 0.8 mit der Penalty auf 1.0). Setz Response (tokens) auf 250 bis 400. Werden die Antworten wirr, senk die Temperatur um 0.1; wirken sie flach, erhöh sie. Ändere immer nur eine Sache, und starte mit den Werten der Modellkarte, falls sie welche angibt.
Charaktere: Karten und Lorebooks
Eine Charakterkarte ist eine kleine Datei, die eine Persona definiert. Das verbreitete Format Chara Card V2 enthält Name, Beschreibung, Persönlichkeit, Szenario, erste Nachricht, Beispieldialoge, alternative Begrüßungen, Tags und optional ein eingebettetes Lorebook. Karten gibt es als JSON oder als PNG-Bilder, in denen das JSON gespeichert ist, sodass Bild und Definition zusammenbleiben. Ein neueres V3-Format erweitert V2, und SillyTavern liest beide. Unser Leitfaden zu Charakterkarten erklärt, wie man eine liest.
Öffne in SillyTavern Character Management (das Karten-Symbol) und nutz Import Character from File für eine PNG- oder JSON-Datei, oder Import content from external URL für einen Link von einer unterstützten Seite wie Chub. Prüf zuerst die Token-Zahl: Eine Karte mit mehr als etwa 2000 Tokens macht einen kleinen Kontext eng. Chub AI ist eine der größten öffentlichen Bibliotheken für Karten und Lorebooks, und ihre Downloads funktionieren in SillyTavern.
Lorebooks, in SillyTavern World Info genannt, enthalten Hintergrundfakten wie Orte, Nebenfiguren und Regeln. Ein Eintrag landet im Prompt, wenn eines seiner Schlüsselwörter in den letzten Nachrichten vorkommt, sodass eine große Spielwelt vor allem dann Kontext kostet, wenn sie gerade relevant ist.
Auch zu Hause gelten Inhaltsregeln. Unser Verzeichnis schließt Karten aus, die auf Minderjährige hindeuten (auch Charaktere, die jung aussehen oder in einem Schulsetting angesiedelt sind), reale Personen und fehlende Einwilligung, wie in unseren Inhaltsrichtlinien festgelegt. Leg denselben Filter an alles an, was du herunterlädst: Ein lokales Modell schreibt alles, was die Karte verlangt, und die Verantwortung liegt bei dir.
Einfachere Optionen
Wenn dir zwei Programme zu viel sind: HammerAI hat eine Desktop-App für Windows, macOS und Linux, die offene Modelle lokal über eine mitgelieferte Kopie von Ollama ausführt, mit einer Oberfläche für Charakter-Chats und ohne Konto für den lokalen Chat. Du tauschst Kontrolle gegen fast null Einrichtung.
Ohne passende Hardware ist eine gehostete Plattform die praktische Wahl: Mehrere haben großzügige Gratis-Tarife und laufen oft mit größeren Modellen, als ein Heim-PC schafft, auf Kosten von Privatsphäre und mit Tageslimits. Die aktuellen Gratis-Limits findest du in unserem Ranking der kostenlosen NSFW-KI-Chats, oder vergleich alle Dienste in der Plattformliste.
Datenschutz und Sicherheit
- Deine Chats sind Dateien. SillyTavern speichert Chats und Charaktere in seinem Datenordner, lesbar für jeden, der dein Benutzerkonto nutzt. Nutz ein Passwort, Festplattenverschlüsselung (BitLocker oder Geräteverschlüsselung unter Windows, FileVault auf dem Mac) und auf geteilten Computern ein eigenes Benutzerkonto.
- Halt die Server lokal. SillyTavern nimmt standardmäßig nur Verbindungen von deinem eigenen Computer an. Wenn du es für dein Heimnetz öffnest, lass die Whitelist aktiv und mach es nie aus dem Internet erreichbar. Lass den Remote Tunnel von KoboldCpp aus und ändere die Bind-Adresse von Ollama nur, wenn du weißt, warum: Wer diese Server erreichen kann, kann sie auch benutzen.
- Behalt im Blick, wohin deine Nachrichten gehen. Ist SillyTavern mit einer Cloud-API verbunden, landen deine Chats bei diesem Anbieter.
- Lade von offiziellen Quellen. Hol dir Modelle von bekannten Autoren auf Hugging Face und bevorzuge GGUF- oder safetensors-Dateien; ältere Pickle-Formate (.bin, .pt, .pth) können beim Laden Code ausführen. Starte nie einen Installer, der angeblich ein Modell ist, und halte dein Backend aktuell, denn Sicherheitslücken beim Einlesen von Modelldateien wurden schon gefunden.
- Nur Erwachsene und nur Fiktion. Erstelle oder teile nie sexuelle Inhalte über reale Personen, und bezieh niemals Minderjährige ein, in keiner Form.
Gehostete Plattformen werfen andere Fragen auf; unsere Datenschutz-Checkliste behandelt sie.
Häufig gestellte Fragen
Kann ich einen NSFW-KI-Chatbot auf meinem eigenen PC betreiben?
Ja. Mit einer Grafikkarte mit 8 GB VRAM oder mehr oder einem Mac mit Apple Silicon und 16 GB Speicher oder mehr kannst du ein offenes Modell mit kostenloser Software wie KoboldCpp und SillyTavern betreiben. Es gibt keinen Plattformfilter und kein Konto, und deine Chats bleiben auf deinem Computer.
Wie viel VRAM brauche ich?
Grob 8 GB für Modelle mit 7 bis 9B, 12 GB für 12 bis 14B, 24 GB für 22 bis 32B und 48 GB für 70B, jeweils in der üblichen 4-Bit-Quantisierung mit 8K bis 16K Tokens Kontext. Mit weniger VRAM kann ein Teil des Modells aus dem Arbeitsspeicher laufen, was funktioniert, die Antworten aber deutlich verlangsamt.
Ist lokales KI-Rollenspiel kostenlos?
Die Software ist kostenlos, die Modelle kannst du gratis herunterladen, und es gibt keine Abos oder Nachrichtenlimits. Du zahlst für Hardware, Strom und deine Zeit.
Wie fange ich am einfachsten an?
Mit fast null Einrichtung: Installier die Desktop-App von HammerAI, die lokale Modelle mit einer Charakter-Oberfläche ausführt. Für mehr Kontrolle nimm KoboldCpp mit SillyTavern unter Windows oder Ollama mit SillyTavern auf dem Mac und fang mit einem Rollenspielmodell der 12B-Klasse an, wenn dein Speicher es zulässt.
Kann ein Mac lokales KI-Rollenspiel ausführen?
Ja, mit einem Apple-Silicon-Chip (M1 oder neuer). Ein Mac mit 16 GB Speicher schafft kleine Modelle, mit 32 GB mittelgroße und mit 64 GB oder mehr auch 70B-Modelle. Ollama, LM Studio, KoboldCpp und SillyTavern laufen alle auf Apple Silicon; Intel-Macs sind weitgehend auf die CPU beschränkt, und die ist langsam.
Ist das legal?
Offene Modelle auf dem eigenen Computer zu betreiben ist in den meisten Ländern legal, aber was du erzeugst, unterliegt dem örtlichen Recht, und die Lizenz eines Modells kann bestimmte Nutzungen einschränken. Sexuelle Inhalte mit Minderjährigen sind in vielen Ländern illegal, selbst wenn sie fiktiv oder KI-generiert sind, und sexuelle Darstellungen realer Personen ohne deren Einwilligung sind an immer mehr Orten illegal oder rechtlich angreifbar. Das ist eine allgemeine Information, keine Rechtsberatung.







