Chatbots IA NSFW en local : du roleplay sans censure sur votre propre PC
Par la rédaction de AI NSFW Bots, mis à jour le
Comment faire tourner du roleplay IA sans censure sur votre propre ordinateur : VRAM selon la taille du modèle, KoboldCpp, Ollama ou LM Studio avec SillyTavern, modèles, réglages et confidentialité.
Faire tourner un chatbot IA NSFW en local, c'est faire fonctionner le modèle de langage sur votre propre ordinateur plutôt que sur les serveurs d'une entreprise : pas de compte, pas de filtre imposé par une plateforme, pas d'abonnement, et vos conversations restent sur votre disque. C'est une solution pour les adultes qui ont un PC gamer bien équipé ou un Mac récent, et que la configuration ne rebute pas. Il vous faut une carte graphique avec au moins 8 Go de VRAM (12 Go ou plus, c'est mieux) ou un Mac Apple Silicon avec 16 Go de mémoire unifiée ou plus. Pour débuter : KoboldCpp et SillyTavern avec un modèle de roleplay de la classe 12B en Q4_K_M, ou un modèle 7 à 9B sur une carte de 8 Go.
Sélection partenaires
Notre méthodeLien affilié. Vérifié en sept. 2026. Les liens n'influencent jamais les notes.
Pourquoi faire tourner un chatbot NSFW en local
- Confidentialité. Les messages vont de SillyTavern à un programme sur le même ordinateur, et nulle part ailleurs, sauf si vous branchez un service cloud.
- Pas de filtre de plateforme. Les plateformes hébergées fixent et modifient leurs propres règles de contenu. En local, les seules limites sont celles que le modèle choisi a apprises à l'entraînement.
- Ni abonnement ni quota de messages. Les logiciels et les modèles sont gratuits ; vous payez le matériel et l'électricité.
- Utilisation hors ligne une fois que tout est téléchargé.
Les inconvénients :
- Le coût du matériel. Une bonne expérience demande 12 Go de VRAM ou plus, ou un Mac de 32 Go pour les modèles de taille moyenne ; cet achat coûte plus cher que de nombreux mois d'abonnement à un service hébergé.
- Le temps d'installation. Deux programmes, un téléchargement de plusieurs gigaoctets et une poignée de réglages qui comptent, plus les mises à jour.
- Les petits modèles écrivent moins bien. Un modèle qui tient sur un GPU de joueur est bien plus petit que les plus gros modèles hébergés : attendez-vous à plus de répétitions, à une mémoire plus faible et à devoir davantage guider le modèle.
- Ni images ni voix d'emblée. KoboldCpp peut charger des modèles d'image et de synthèse vocale, et SillyTavern a des extensions pour les deux, mais chacun demande ses propres téléchargements et sa propre mémoire.
Matériel : de combien de mémoire avez-vous besoin
Le modèle doit tenir dans une mémoire rapide : la VRAM de votre carte graphique, ou la mémoire unifiée d'un Mac Apple Silicon. Le tableau donne des estimations approximatives, pas des mesures, pour du Q4_K_M (la quantification 4 bits courante, expliquée plus bas) avec une taille de contexte qui tient confortablement ; l'usage réel varie selon le modèle et le backend.
| Taille du modèle | VRAM du GPU | Mémoire du Mac | Contexte | Idéal pour |
|---|---|---|---|---|
| 7 à 9B | 8 Go | 16 Go | 8K à 16K | Réponses rapides sur des GPU modestes ; perd le fil plus vite |
| 12 à 14B | 12 Go | 16 à 24 Go | 8K à 16K | Un équilibre populaire entre qualité et vitesse |
| 22 à 27B | 24 Go (16 Go avec une quantification plus légère) | 32 Go | 16K à 32K | Personnages plus cohérents, meilleure prose |
| 30 à 32B | 24 Go | 36 à 48 Go | 8K à 16K | Meilleure logique des scènes ; remplit une carte de 24 Go |
| 70B | 48 Go (deux cartes) | 64 Go ou plus | 8K à 16K | La meilleure écriture de ce tableau ; demande du gros matériel |
Une vérification rapide, valable pour n'importe quel modèle : la taille du fichier GGUF plus 2 à 5 Go pour le contexte et l'espace de travail doit tenir dans votre VRAM. Pour vous repérer, les cartes de 12 Go incluent la RTX 3060 12 Go, la 4070 et la 5070 ; celles de 16 Go, la RTX 4060 Ti 16 Go, la 4080 et la 5080 ; celles de 24 Go, la RTX 3090 et la 4090. Les GPU de portables ont souvent moins de VRAM que la carte de bureau du même nom ; le Gestionnaire des tâches affiche la vôtre sous Performances, GPU.
Les cartes NVIDIA sont les plus simples, puisque tous les outils prennent en charge CUDA. Les cartes AMD et Intel fonctionnent via Vulkan (et ROCm chez AMD), avec plus de configuration et souvent moins de vitesse.
VRAM, RAM système et déchargement
Si un modèle ne tient pas dans la VRAM, KoboldCpp, Ollama et LM Studio peuvent en garder une partie dans la RAM système et faire tourner cette partie sur le CPU. Ça marche, mais la RAM système est bien plus lente : quelques couches à cet endroit coûtent un peu de vitesse, la moitié du modèle peut rendre les réponses plusieurs fois plus lentes. Prévoyez 32 Go de RAM si vous comptez décharger une partie du modèle.
Les modèles à mélange d'experts (MoE) s'en sortent mieux. Un nom comme 35B-A3B signifie 35 milliards de paramètres au total, dont environ 3 milliards actifs par token : la mémoire dépend du total, la vitesse de la partie active, si bien que ces modèles restent utilisables quand ils sont en partie dans la RAM système.
Apple Silicon et mémoire unifiée
Sur les Mac de la série M, le CPU et le GPU partagent une seule réserve de mémoire, si bien qu'un Mac de 32 ou 64 Go peut charger des modèles qui exigeraient une carte graphique coûteuse sur un PC. macOS en garde une partie : comptez qu'environ les deux tiers aux trois quarts seront disponibles pour le modèle. La vitesse dépend de la bande passante mémoire, plus élevée sur les puces Pro, Max et Ultra, et les longs prompts sont traités plus lentement que sur une configuration NVIDIA comparable. Les Mac Intel sont pour l'essentiel limités au CPU.
Personnages populaires
LovescapeGratuit293 discussionsVidéoBaylie
Hey cutie… caught me mid-stretch with the tower watching These red shorts are on duty — you gonna behave or need mouth-to-mouth?
Chat gratuit ↗
Secret DesiresGratuitBonnie Mae
I’ve never been the kind of person who wastes money on things that don’t grow—so I’ve turned every dollar into a promise, an investment, a whisper…
Chat gratuit ↗
Candy.aiGratuitVidéoMolly Ellery
Your brother's fiancée is alone poolside And looking way too tempting
Chat gratuit ↗
LovescapeGratuit846 discussionsVidéoRuby
Steam rising, burgundy dripping, blue eyes locked on you Towel turban game strong today. Feeling soft, slick, and a little daring. Slide in and…
Chat gratuit ↗Logiciels : un backend plus un frontend
Le backend charge le modèle et génère le texte. Le frontend est l'application de chat que vous utilisez : il stocke les personnages, construit chaque prompt et l'envoie au backend. SillyTavern est le frontend de référence pour le roleplay et fonctionne avec tous les backends ci-dessous.
| Outil | Ce que c'est | Systèmes | Difficulté | Idéal pour |
|---|---|---|---|---|
| KoboldCpp | Backend en un seul fichier avec une page de chat simple | Windows, Linux, macOS | Facile | Première installation, surtout sous Windows |
| Ollama | Serveur de modèles avec une petite appli | Windows, macOS, Linux | Facile | Mac et Linux ; téléchargement rapide des modèles |
| LM Studio | Appli de bureau : catalogue de modèles, chat, serveur | Windows, macOS, Linux | Le plus facile | Essayer des modèles sans terminal |
| TextGen (oobabooga) | Appli avec une interface web et plusieurs moteurs | Windows, Linux, macOS | Moyen | Les bidouilleurs qui veulent tous les réglages |
| llama.cpp server | Le moteur sur lequel repose une grande partie de ces outils | Windows, Linux, macOS | Avancé | Adeptes de la ligne de commande, fonctions les plus récentes |
| SillyTavern | Frontend de roleplay | Windows, Linux, macOS, Android | Moyen | Personnages, lorebooks, presets |
TextGen est le nouveau nom de text-generation-webui, souvent appelé oobabooga d'après le pseudo de son auteur. LM Studio est gratuit pour un usage personnel comme professionnel, mais son code est fermé ; les autres sont open source. La bibliothèque propre à Ollama contient surtout des modèles généralistes, mais il peut récupérer des fine-tunes de roleplay sur Hugging Face.
Sources officielles : KoboldCpp sur github.com/LostRuins/koboldcpp, SillyTavern sur github.com/SillyTavern/SillyTavern, Ollama sur ollama.com, LM Studio sur lmstudio.ai, TextGen sur github.com/oobabooga/textgen, llama.cpp sur github.com/ggml-org/llama.cpp, et les modèles sur huggingface.co.
Modèles : fichiers GGUF, quantification et fine-tunes
GGUF et quantification
Tous les backends ci-dessus chargent le GGUF, le format de fichier de llama.cpp : un seul fichier avec les poids plus des métadonnées comme le template de chat. Les gros modèles peuvent être découpés en parties numérotées ; chargez la première.
La quantification stocke chaque poids sur moins de bits que les 16 d'origine, ce qui réduit l'usage de la mémoire au prix d'une certaine perte de qualité :
- Q8_0 : environ 8.5 bits par poids, pratiquement impossible à distinguer de l'original.
- Q6_K : environ 6.6 bits, très proche de l'original.
- Q5_K_M : environ 5.7 bits, un léger cran en dessous.
- Q4_K_M : environ 4.8 bits, soit à peu près 0.6 Go par milliard de paramètres. Le choix par défaut habituel, qui échange une perte de qualité modeste contre une grosse économie.
- En dessous de Q4 (Q3_K_M, Q2_K et similaires) : dégradation sensible, pire sur les petits modèles.
Un modèle plus gros en Q4_K_M écrit généralement mieux qu'un plus petit de la même famille en Q8_0 : consacrez donc la mémoire à la taille en priorité. Les noms qui commencent par IQ, comme IQ4_XS, utilisent une autre méthode : plus petits à qualité similaire, parfois plus lents.
Familles de base et fine-tunes communautaires
La plupart des modèles de roleplay locaux sont des fine-tunes communautaires : des modèles de base ouverts issus de grands laboratoires, entraînés davantage sur de la fiction et du jeu de rôle. Parmi les familles de base qu'on retrouve dans les noms de modèles : Llama (Meta), Mistral et Mistral Nemo (Mistral AI), Qwen (Alibaba) et Gemma (Google) ; beaucoup de modèles populaires fusionnent plusieurs fine-tunes. L'étiquette « uncensored » (non censuré) est une promesse vague que le modèle ne refuse rien ; « abliterated » signifie que les refus ont été supprimés en modifiant les poids.
Nous ne désignons volontairement pas de meilleur modèle : les fine-tunes vont et viennent en quelques semaines. Cherchez sur Hugging Face une famille et une taille que vous pouvez faire tourner, avec GGUF, triez par tendance ou par mise à jour récente, et regardez ce que disent les subreddits SillyTavern et LocalLLaMA des dernières sorties.
Comment lire la fiche d'un modèle
- Le modèle de base, indiqué sur la fiche ou dans le panneau Model tree de Hugging Face. C'est lui qui détermine en grande partie le template d'instruction.
- La taille. Le nombre de paramètres vous indique quelle ligne du tableau matériel s'applique ; pour les modèles MoE, prenez le total.
- La longueur de contexte. Beaucoup de fine-tunes se dégradent bien avant le maximum du modèle de base ; les bonnes fiches précisent à partir d'où.
- La licence. Vérifiez-la, ainsi que celle du modèle de base. Les sorties ouvertes récentes de Qwen, Mistral et Gemma utilisent Apache 2.0 ; Llama utilise la licence communautaire de Meta, assortie d'une politique d'utilisation acceptable.
- L'usage prévu et les réglages recommandés, y compris le template d'instruction et les valeurs de sampler testés par l'auteur.
- Les liens GGUF. Les fichiers quantifiés se trouvent généralement dans un dépôt séparé avec GGUF dans son nom, lié depuis le Model tree.
Comment juger un modèle vous-même
- Utilisez la même fiche de personnage, le même message d'ouverture et les mêmes réglages pour chaque modèle, en ne changeant que le template d'instruction.
- Générez trois à cinq réponses au même message (les swipes, dans SillyTavern) et comparez-les.
- Vérifiez que le personnage garde sa voix et ses faits, n'écrit pas vos répliques, varie ses formulations et ne glisse jamais vers un langage d'assistant.
- Continuez sur 30 à 50 messages, puis posez une question sur un élément du début de la conversation.
- Gardez le modèle qui se trompe le moins.
Installations pas à pas
Les noms de menus, laissés en anglais, correspondent aux versions actuelles ; si l'un d'eux a changé de place, consultez la documentation du projet.
Option 1 : KoboldCpp et SillyTavern sous Windows
- Téléchargez KoboldCpp depuis sa page de releases sur GitHub : koboldcpp.exe pour les cartes NVIDIA, koboldcpp-nocuda.exe pour les cartes graphiques AMD ou Intel.
- Téléchargez un fine-tune de roleplay sous forme de fichier GGUF en Q4_K_M, dans une taille que votre VRAM permet. Le bouton HF Search du lanceur peut aussi trouver des modèles.
- Lancez koboldcpp.exe. Windows peut afficher un avertissement sur une application non reconnue, ce qui est courant avec les programmes open source non signés.
- Dans l'onglet Quick Launch, vérifiez que Backend affiche Use CUDA (NVIDIA) ou Use Vulkan (AMD, Intel), puis cliquez sur Browse à côté de GGUF Text Model et choisissez votre fichier.
- Laissez GPU Layers sur -1 (automatique) pour commencer. Si le fichier tient dans votre VRAM avec de la marge, saisissez le nombre total de couches affiché à côté, pour que toutes les couches aillent sur le GPU.
- Réglez Context Size sur 8192 ou 16384 et cliquez sur Launch. La page de chat de KoboldCpp s'ouvre à l'adresse
http://localhost:5001une fois le chargement terminé. - Installez Node.js (LTS) et Git. Dans un dossier qui vous appartient (pas dans Program Files), lancez
git clone https://github.com/SillyTavern/SillyTavern -b releasedans un terminal, puis double-cliquez sur Start.bat dans le nouveau dossier. SillyTavern s'ouvre à l'adressehttp://127.0.0.1:8000. - Ouvrez API Connections (l'icône de prise), réglez API sur Text Completion et API Type sur KoboldCpp, saisissez
http://localhost:5001comme API URL, cochez Derive context size from backend et cliquez sur Connect. - Ouvrez AI Response Formatting (l'icône A), activez Instruct Mode et activez les options qui déduisent du modèle les templates de contexte et d'instruction. Si le template n'est pas reconnu, choisissez celui qu'indique la fiche du modèle.
Option 2 : Ollama et SillyTavern sous macOS ou Linux
- Installez Ollama : l'application depuis ollama.com sous macOS (version 14 ou ultérieure, Apple Silicon pour utiliser le GPU), ou sous Linux la commande
curl -fsSL https://ollama.com/install.sh | sh. - Récupérez un fine-tune de roleplay sur Hugging Face avec
ollama pull hf.co/user/repository:Q4_K_M, en utilisant le chemin du modèle ; l'étiquette après les deux-points choisit la quantification. - Laissez Ollama tourner (l'application, le service Linux ou
ollama serve) ; il écoute surhttp://127.0.0.1:11434. - Installez Node.js et Git (Homebrew est le plus simple sur Mac), puis lancez
git clone https://github.com/SillyTavern/SillyTavern -b release,cd SillyTavernet./start.sh. - Dans API Connections, choisissez Text Completion, API Type Ollama et API URL
http://127.0.0.1:11434, cliquez sur Connect et choisissez votre modèle sous Ollama Model. - Dans AI Response Formatting, activez Instruct Mode et sélectionnez le template indiqué par la fiche du modèle ; la détection automatique ne fonctionne pas avec Ollama.
- Dans AI Response Configuration (l'icône des curseurs), réglez Context (tokens), en cochant Unlocked pour dépasser 8K. SillyTavern transmet cette valeur à Ollama à chaque requête.
Option 3 : LM Studio, une seule application
- Installez LM Studio depuis lmstudio.ai. Il fonctionne sur les Mac Apple Silicon (macOS 14 ou ultérieur), les PC Windows (x64 avec AVX2, ou ARM) et Linux.
- Dans l'onglet Discover, cherchez un fine-tune de roleplay et téléchargez un fichier Q4_K_M ; LM Studio signale les fichiers qui devraient tenir en mémoire.
- Dans l'onglet Chat, ouvrez le chargeur de modèles, choisissez le modèle et réglez la longueur de contexte et le déchargement sur le GPU (GPU offload).
- Décrivez le personnage et le scénario dans le prompt système et enregistrez-le comme preset. Les Mac peuvent aussi faire tourner des modèles MLX, un format propre à Apple qui peut être plus rapide.
- Pour les fiches de personnage, démarrez le serveur dans l'onglet Developer, connectez SillyTavern via Text Completion avec API Type Generic (OpenAI-compatible) et l'URL
http://127.0.0.1:1234, puis réglez le template d'instruction comme dans l'option 2.
Les réglages qui comptent pour le roleplay
Longueur de contexte
Le contexte est la mémoire de travail du modèle, comptée en tokens ; un token vaut à peu près les trois quarts d'un mot anglais, donc 8K tokens contiennent environ 6 000 mots. Le prompt système, la fiche du personnage, les entrées de lorebook et les messages récents se le partagent, et SillyTavern abandonne les messages les plus anciens quand il est plein. Plus de contexte coûte de la mémoire et du temps : 8K à 16K est donc la fourchette pratique ; utilisez la même valeur dans le backend et dans SillyTavern.
Température, min-p et top-p
La température règle le hasard : plus haute, elle donne un texte plus varié et plus d'erreurs ; plus basse, un texte plus sûr et plus plat. Min-p écarte les mots peu probables par rapport au meilleur choix (à 0.05, tout mot moins de 5 % aussi probable que lui), ce qui garde le texte cohérent à des températures plus élevées. Top-p et top-k sont des filtres plus anciens et plus grossiers ; avec min-p, réglez top-p sur 1 et top-k sur 0 pour les désactiver.
Pénalité de répétition
La pénalité de répétition rend les mots utilisés récemment moins probables. Gardez-la basse, autour de 1.05 à 1.1 sur les 1 000 à 2 000 derniers tokens (Rep. Pen. Range dans SillyTavern) ; des valeurs plus élevées poussent le modèle à éviter les prénoms et les mots courants. Avec KoboldCpp, llama.cpp et TextGen, SillyTavern propose aussi DRY, qui cible les phrases répétées : réglez son multiplicateur autour de 0.8, gardez ses autres valeurs par défaut et descendez la pénalité ordinaire à 1.0.
Templates d'instruction
Les modèles entraînés à suivre des instructions attendent des conversations encadrées par des balises précises, comme ChatML ou les formats Llama 3, Mistral et Gemma. SillyTavern met en forme le prompt avec le template que vous sélectionnez, et une erreur se voit : le modèle écrit vos répliques, affiche des balises parasites, continue sans s'arrêter ou perd la voix du personnage. La fiche du modèle indique le bon. Certains modèles récents écrivent un bloc de raisonnement avant de répondre, ce qui coûte du temps et des tokens ; désactivez-le quand le modèle le permet.
Un preset de départ raisonnable
Dans AI Response Configuration, cliquez sur Neutralize Samplers, puis réglez Temperature entre 0.8 et 1.0, Min P entre 0.05 et 0.1, Top P sur 1, Top K sur 0 et Repetition Penalty sur 1.05 sur 2 048 tokens (ou DRY à 0.8 avec la pénalité à 1.0). Réglez Response (tokens) entre 250 et 400. Si les réponses deviennent incohérentes, baissez la température de 0.1 ; si elles semblent plates, montez-la. Changez une seule chose à la fois, et partez des valeurs de la fiche du modèle quand elle en donne.
Personnages : fiches et lorebooks
Une fiche de personnage (character card) est un petit fichier qui définit un persona. Le format courant Chara Card V2 contient un nom, une description, une personnalité, un scénario, un premier message, des exemples de dialogue, des salutations alternatives, des tags et un lorebook intégré facultatif. Les fiches se présentent en JSON ou en images PNG avec le JSON stocké à l'intérieur, si bien que l'image et la définition voyagent ensemble. Un format V3 plus récent étend le V2, et SillyTavern lit les deux. Notre guide des fiches de personnage explique comment en lire une.
Dans SillyTavern, ouvrez Character Management (l'icône de fiche) et utilisez Import Character from File pour un PNG ou un JSON, ou Import content from external URL pour un lien vers un site pris en charge comme Chub. Vérifiez d'abord le nombre de tokens : une fiche de plus de 2 000 tokens environ encombre un petit contexte. Chub AI est l'une des plus grandes bibliothèques publiques de fiches et de lorebooks, et ses téléchargements fonctionnent dans SillyTavern.
Les lorebooks, appelés World Info dans SillyTavern, contiennent des éléments de contexte comme des lieux, des personnages secondaires et des règles. Une entrée est ajoutée au prompt quand l'un de ses mots-clés apparaît dans les messages récents, si bien qu'un univers étendu coûte du contexte surtout quand il sert.
Les règles de contenu s'appliquent aussi chez vous. Notre annuaire exclut les fiches qui suggèrent des mineurs (y compris les personnages qui ont l'air jeunes ou évoluent dans un cadre scolaire), des personnes réelles ou l'absence de consentement, comme l'expose notre politique de contenu. Appliquez le même filtre à ce que vous téléchargez : un modèle local écrit tout ce que la fiche demande, et la responsabilité vous revient.
Des options plus simples
Si deux programmes, c'est plus que vous n'en voulez, HammerAI propose une application de bureau pour Windows, macOS et Linux qui fait tourner des modèles ouverts en local grâce à une copie intégrée d'Ollama, avec une interface de chat avec des personnages et sans compte nécessaire pour le chat local. Vous sacrifiez du contrôle en échange d'une installation quasi nulle.
Sans matériel adapté, une plateforme hébergée est le choix pratique : plusieurs ont des offres gratuites généreuses et font souvent tourner des modèles plus gros qu'un PC domestique, au prix de la confidentialité et de limites quotidiennes. Consultez les limites gratuites actuelles dans notre classement des chats IA NSFW gratuits, ou comparez tous les services dans la liste des plateformes.
Confidentialité et sécurité
- Vos conversations sont des fichiers. SillyTavern stocke les conversations et les personnages dans son dossier de données, lisible par toute personne qui utilise votre session. Utilisez un mot de passe, le chiffrement du disque (BitLocker ou le chiffrement de l'appareil sous Windows, FileVault sur Mac) et votre propre session sur les ordinateurs partagés.
- Gardez les serveurs en local. Par défaut, SillyTavern n'accepte que les connexions venant de votre propre ordinateur. Si vous l'ouvrez à votre réseau domestique, laissez sa liste blanche (whitelist) activée et ne l'exposez jamais à Internet. Laissez le Remote Tunnel de KoboldCpp désactivé et ne modifiez pas l'adresse d'écoute d'Ollama sans savoir pourquoi : n'importe qui pouvant atteindre ces serveurs peut s'en servir.
- Sachez où vont les messages. Si SillyTavern est connecté à une API cloud, vos conversations partent chez ce fournisseur.
- Téléchargez depuis les sources officielles. Prenez les modèles d'auteurs connus sur Hugging Face et préférez les fichiers GGUF ou safetensors ; les anciens formats pickle (.bin, .pt, .pth) peuvent exécuter du code au chargement. N'exécutez jamais un installeur qui prétend être un modèle, et tenez votre backend à jour : des failles de sécurité dans la lecture des fichiers de modèles ont déjà été découvertes.
- Adultes et fiction uniquement. Ne créez ni ne partagez jamais de contenu sexuel sur des personnes réelles, et n'impliquez jamais de mineurs, sous aucune forme.
Les plateformes hébergées soulèvent d'autres questions ; notre check-list confidentialité les passe en revue.
Questions fréquentes
Puis-je faire tourner un chatbot IA NSFW sur mon propre PC ?
Oui. Avec une carte graphique dotée de 8 Go de VRAM ou plus, ou un Mac Apple Silicon avec 16 Go de mémoire ou plus, vous pouvez faire tourner un modèle ouvert avec des logiciels gratuits comme KoboldCpp et SillyTavern. Il n'y a ni filtre de plateforme ni compte, et vos conversations restent sur votre ordinateur.
De combien de VRAM ai-je besoin ?
Environ 8 Go pour les modèles 7 à 9B, 12 Go pour les 12 à 14B, 24 Go pour les 22 à 32B et 48 Go pour les 70B, avec la quantification 4 bits courante et 8K à 16K tokens de contexte. Avec moins de VRAM, une partie du modèle peut tourner depuis la RAM système, ce qui fonctionne mais ralentit considérablement les réponses.
Le roleplay IA en local est-il gratuit ?
Les logiciels sont gratuits, les modèles se téléchargent gratuitement, et il n'y a ni abonnement ni limite de messages. Vous payez le matériel, l'électricité et votre temps.
Quelle est la façon la plus simple de commencer ?
Pour une installation quasi nulle, installez l'application de bureau de HammerAI, qui fait tourner des modèles locaux avec une interface de personnages. Pour plus de contrôle, utilisez KoboldCpp avec SillyTavern sous Windows, ou Ollama avec SillyTavern sur Mac, en commençant par un modèle de roleplay de la classe 12B si votre mémoire le permet.
Un Mac peut-il faire tourner du roleplay IA en local ?
Oui, avec une puce Apple Silicon (M1 ou plus récente). Un Mac avec 16 Go de mémoire gère les petits modèles, 32 Go les modèles de taille moyenne, et 64 Go ou plus les modèles 70B. Ollama, LM Studio, KoboldCpp et SillyTavern fonctionnent tous sur Apple Silicon ; les Mac Intel sont pour l'essentiel limités au CPU, qui est lent.
Est-ce légal ?
Faire tourner des modèles ouverts sur votre propre ordinateur est légal dans la plupart des pays, mais ce que vous générez est soumis à la loi locale, et la licence d'un modèle peut restreindre certains usages. Les contenus sexuels impliquant des mineurs sont illégaux dans de nombreux pays, même lorsqu'ils sont fictifs ou générés par IA, et les contenus sexuels représentant des personnes réelles sans leur consentement sont illégaux ou passibles de poursuites dans un nombre croissant d'endroits. Il s'agit d'informations générales, pas d'un conseil juridique.







