Location Mac

Qwen3.8-27B sur Mac 16 Go : dépannage 2026

MacHTML Lab2026.08.19 ~16 min de lecture
Qwen3.8-27B sur Mac 16 Go : dépannage 2026

Symptôme : Qwen3.8-27B se charge mal, fait ralentir macOS ou affiche seulement sa réflexion sur votre Mac de 16 Go.
Solution la plus rapide : réduisez le contexte, désactivez thinking et fermez les applications concurrentes ; si l’échange mémoire continue, cessez d’optimiser et passez à un modèle plus petit ou à un Mac doté de davantage de mémoire unifiée.

Cet article est destiné aux utilisateurs qui exécutent déjà qwen3.8:27b ou qwen3.8:27b-mlx dans Ollama, aux développeurs qui préparent un agent de code ou une analyse documentaire, ainsi qu’aux petites équipes qui hésitent entre changer de machine et louer un environnement distant.

Dernière mise à jour : 19 août 2026. Informations vérifiées à partir du dépôt officiel Qwen3.8, de la fiche du modèle, de la documentation Ollama et de la documentation Apple.

Le poids du modèle face à la mémoire disponible

Le premier diagnostic est matériel, pas syntaxique. La page actuelle d’Ollama indique environ 18 Go pour les variantes qwen3.8:27b et qwen3.8:27b-mlx, alors qu’un Mac annoncé avec 16 Go dispose de cette quantité pour l’ensemble du système, et non pour le modèle seul. Le téléchargement peut donc réussir alors que l’inférence stable reste impossible. Consultez la page officielle du modèle dans Ollama et le dépôt officiel Qwen3.8 pour vérifier les étiquettes et les fichiers disponibles. (github.com)

La mémoire unifiée doit absorber simultanément :

  • les poids quantifiés du modèle ;
  • macOS et sa mémoire câblée ;
  • le moteur Ollama ou MLX ;
  • le cache associé au contexte ;
  • les applications ouvertes, notamment un navigateur, un environnement de développement, un logiciel audio ou vidéo ;
  • les requêtes parallèles et l’historique conservé par un agent.

Le chiffre de 18 Go n’est donc pas une recommandation de mémoire minimale. Il indique seulement la taille approximative du paquet téléchargé. Le modèle n’a pas été officiellement garanti pour fonctionner de manière stable sur un Mac de 16 Go. Réduire num_ctx peut diminuer le cache, mais ne supprime pas l’écart entre le poids du modèle et la mémoire physique disponible.

Qwen3.8-27B a été rendu disponible le 14 août 2026. Le dépôt officiel le présente comme un modèle dense de 27 milliards de paramètres, avec contrôle de la profondeur de raisonnement via reasoning_effort et conservation possible du raisonnement historique avec preserve_thinking. Ces fonctions sont particulièrement coûteuses dans un scénario d’agent ou de conversation prolongée. (github.com)

Les symptômes qui ne désignent pas la même panne

Un même Mac peut afficher trois comportements très différents. Les traiter comme un seul problème conduit à modifier trop de paramètres à la fois et à perdre la cause réelle.

Chargement interrompu

Le modèle commence à se charger, puis Ollama quitte, renvoie une erreur ou ne répond plus. Dans ce cas, vérifiez d’abord :

  1. la version installée d’Ollama ;
  2. le nom exact du modèle ;
  3. l’espace disque disponible ;
  4. la présence d’un autre modèle déjà chargé ;
  5. les journaux du moteur.

Un échec immédiat peut correspondre à une incompatibilité de version ou de format. Ce n’est pas encore une preuve que le Mac est définitivement trop faible. En revanche, si le modèle échoue après fermeture des applications et redémarrage d’Ollama, la contrainte mémoire devient prioritaire.

Génération possible mais très lente

Une réponse finit par apparaître, mais la première sortie arrive très tard et l’interface devient peu réactive. C’est le scénario typique d’un modèle qui repose fortement sur la mémoire système ou sur l’échange disque.

Exécutez :

ollama ps

La colonne PROCESSOR peut afficher 100% GPU, 100% CPU ou un partage entre CPU et GPU. Un partage CPU/GPU n’est pas automatiquement une panne : Ollama documente ce comportement comme un chargement partiel dans les deux espaces mémoire. Il devient préoccupant lorsqu’il s’accompagne d’une pression mémoire persistante, d’un échange qui augmente et d’une dégradation visible de l’ordinateur. (docs.ollama.com)

Blocage après plusieurs tours

Le premier prompt fonctionne, puis les tours suivants ralentissent ou figent le système. Cette progression désigne souvent un contexte qui grossit, un historique de raisonnement conservé ou plusieurs requêtes traitées en parallèle.

Pour un agent de code, le problème peut apparaître plus vite qu’avec une question isolée : fichiers lus, sorties de commandes, messages précédents et réponses intermédiaires s’ajoutent au contexte. Une démonstration réussie une fois ne constitue donc pas une validation opérationnelle.

Vérification dans Ollama et Activité du moniteur

Commencez par établir une base reproductible. Ne testez pas simultanément une image, un dépôt complet, un agent et une conversation longue.

Utilisez cette séquence :

  1. redémarrez Ollama ;
  2. fermez les modèles non utilisés ;
  3. quittez les applications lourdes ;
  4. lancez une requête texte courte ;
  5. vérifiez ollama ps pendant la génération ;
  6. ouvrez Moniteur d’activité > Mémoire ;
  7. répétez exactement la même requête plusieurs fois.

Apple indique que la pression mémoire dépend notamment de la mémoire libre, de la mémoire compressée, de la mémoire câblée et du taux d’échange. La rubrique Swap Used correspond à l’espace du disque utilisé pour déplacer des données entre la mémoire vive et le stockage. Une hausse continue de cette valeur, accompagnée d’une interface qui se fige, est un signal plus utile qu’une simple lecture de la mémoire utilisée. (support.apple.com)

Ollama fonctionne-t-il lentement parce que la mémoire est insuffisante ?

C’est probable lorsque trois indices apparaissent ensemble : le modèle est chargé en partie dans la mémoire système, la pression mémoire reste élevée pendant la génération et Swap Used progresse. Un seul indice ne suffit pas. Une application en arrière-plan, une version d’Ollama ou une requête très longue peuvent aussi modifier le résultat.

Utilisez la checklist suivante avant de conclure :

  • [ ] Fermer les navigateurs, environnements de développement et logiciels créatifs non nécessaires.
  • [ ] Quitter les autres modèles avec Ollama.
  • [ ] Redémarrer Ollama et le Mac si l’échange continue après l’arrêt de la requête.
  • [ ] Lancer une requête texte courte, sans image ni outil.
  • [ ] Relever l’état de PROCESSOR dans ollama ps.
  • [ ] Observer la pression mémoire et Swap Used avant, pendant et après la requête.
  • [ ] Rejouer le même test au moins sur plusieurs tours.
  • [ ] Arrêter le test si le système reste lent après la fin de la génération.

Le guide d’aide de MacHTML peut également servir de point de départ pour vérifier l’accès à un environnement distant lorsque votre Mac local ne permet pas de reproduire le test proprement.

Thinking visible et réponse absente

Qwen active par défaut le raisonnement sur les modèles de cette famille. Le modèle peut produire un bloc de réflexion avant sa réponse finale. La fiche officielle Qwen documente aussi les modes avec enable_thinking=True ou enable_thinking=False, ainsi que les commutateurs /think et /no_think dans les interfaces compatibles. La méthode exacte dépend toutefois de l’interface utilisée. (huggingface.co)

Comment désactiver thinking avec Qwen3.8-27B ?

Commencez par la méthode exposée par votre version d’Ollama ou par votre interface compatible. Dans une interface qui accepte les commandes de conversation, essayez un mode non réflexif avec /no_think. Dans une API compatible avec les paramètres Qwen, le contrôle peut prendre la forme de enable_thinking: false ou d’un réglage de profondeur tel que reasoning_effort.

Ne copiez pas mécaniquement un exemple SGLang dans Ollama. La documentation Qwen précise que certains paramètres ne sont pas compatibles avec toutes les API. Pour une intégration personnalisée, vérifiez la fiche du modèle et la documentation du serveur réellement utilisé avant de modifier votre code. (github.com)

Testez ensuite une tâche qui exige une réponse finale courte :

Répondez en trois phrases. Donnez uniquement la conclusion, sans raisonnement détaillé.

Si la sortie s’arrête dans un bloc de réflexion, le plafond de sortie est peut-être trop bas. Une requête courte peut consommer une partie importante de sa limite avant d’atteindre la réponse finale. Dans ce cas, augmentez temporairement la limite de sortie pour le diagnostic, puis désactivez thinking ou réduisez l’effort de raisonnement pour l’usage courant.

Contexte court contre contexte ambitieux

Ollama documente num_ctx comme la taille de la fenêtre de contexte utilisée pour générer la réponse. Sa documentation indique que le contexte par défaut dépend de la mémoire disponible, avec 4 096 jetons pour les environnements disposant de moins de 24 Gio de VRAM dans le cas général documenté. Elle précise aussi qu’un contexte plus grand augmente la mémoire nécessaire. (docs.ollama.com)

Réduire num_ctx permet-il de faire fonctionner Qwen3.8-27B sur un Mac de 16 Go ?

Cela peut réduire la pression supplémentaire du cache, mais cela ne transforme pas un Mac de 16 Go en environnement adapté à un modèle dont le paquet Ollama avoisine 18 Go. Utilisez cette modification comme test de stabilité, pas comme garantie.

Dans un Modelfile, la forme documentée est :

FROM qwen3.8:27b
PARAMETER num_ctx 4096

Puis :

ollama create qwen38-test -f Modelfile
ollama run qwen38-test

Vous pouvez aussi définir num_ctx dans une requête API ou avec la commande /set parameter num_ctx lorsque l’interface le permet. La syntaxe et la valeur acceptée doivent être vérifiées dans la version installée. (docs.ollama.com)

Pendant le diagnostic, restez sur :

  • texte uniquement ;
  • une seule conversation ;
  • un seul modèle chargé ;
  • un contexte réduit ;
  • aucune image ;
  • aucune exécution d’outil ;
  • aucune requête parallèle.

Les entrées visuelles, les fichiers volumineux, les sorties de terminal et l’historique de raisonnement peuvent faire varier fortement l’occupation réelle. C’est particulièrement important pour les usages créatifs : analyse d’une piste audio transcrite, storyboard vidéo, planche de référence graphique ou catalogue de fichiers de design.

Ordre de réduction des risques

Ne changez pas tout à la fois. Suivez un ordre réversible.

1. Nettoyage de l’environnement

Fermez les logiciels qui consomment de la mémoire. Dans un flux audio ou vidéo, mettez en pause le logiciel de montage, la prévisualisation et les applications de rendu. Le but est de mesurer le modèle dans un environnement presque vide.

2. Réduction du contexte

Créez un profil de test avec un num_ctx modeste. Gardez la même valeur pour toutes les comparaisons. Ne passez pas directement à une fenêtre maximale parce que le modèle la supporte sur une autre machine.

3. Désactivation de thinking

Utilisez /no_think, enable_thinking: false ou le paramètre de profondeur adapté à votre interface. Notez précisément la méthode et la version d’Ollama utilisée.

4. Requête courte

Employez une question déterministe et facile à vérifier, par exemple une transformation de code de quelques lignes ou un résumé d’un court paragraphe.

5. Répétition

Rejouez la même tâche sur plusieurs tours. Surveillez la pression mémoire, l’échange et la réactivité du système. Le critère n’est pas « le modèle a répondu une fois », mais « le modèle termine la tâche sans rendre le Mac inutilisable ».

6. Arrêt du test

Si l’échange augmente toujours, si la réponse devient imprévisible ou si macOS reste lent après la requête, arrêtez. Réduire encore la sortie peut masquer le problème sans fournir une expérience exploitable.

Modèle plus petit contre Mac mieux équipé

Pour une question ponctuelle, un modèle plus petit est généralement la décision la plus rationnelle. Vous perdez une partie des capacités de raisonnement, de vision ou d’agent, mais vous gagnez une boucle de test plus rapide et une machine disponible pour votre éditeur, votre navigateur ou votre logiciel créatif.

Pour un agent de code, une analyse longue, une entrée visuelle ou une succession de tâches, le modèle de 27B peut rester pertinent. Dans ce cas, un environnement avec davantage de mémoire unifiée est préférable à une succession de réglages extrêmes.

Situation observée Décision recommandée Pourquoi
Question courte, test de prompt, résumé simple Modèle plus petit Moins de mémoire et diagnostic plus rapide
Code ponctuel sans historique long Modèle plus petit ou contexte réduit Le 27B n’apporte pas toujours un gain justifiant l’échange
Agent de code avec dépôt et plusieurs tours Mac mieux équipé Le contexte et les sorties d’outils s’accumulent
Analyse d’images, vidéo ou documents volumineux Mac mieux équipé Les entrées multimodales augmentent la pression mémoire
Besoin irrégulier, projet temporaire Mac distant loué à la demande Vous validez le modèle sans acheter immédiatement une machine
Usage quotidien, données strictement locales Mise à niveau d’un Mac local Le coût récurrent d’un environnement distant peut devenir moins adapté

Le guide de MacHTML sur la console distante est utile pour préparer une session de validation avec un environnement isolé. Pour un besoin récurrent, comparez ensuite le coût et la disponibilité sur la page de location MacHTML, sans supposer qu’une location est toujours préférable à un achat.

Protocole de comparaison

Ne comparez pas seulement la vitesse d’apparition du premier jeton. Une machine qui répond vite sur une question courte peut échouer sur le troisième tour.

Élément à conserver identique Mesure à relever
Étiquette du modèle Chargement complet ou partiel
Prompt Temps avant la première sortie
num_ctx Pression mémoire pendant la tâche
Mode thinking Progression de Swap Used
Nombre de tours Fin correcte de la tâche
Entrées texte ou image Réactivité du système après exécution

Utilisez le même modèle, le même prompt et le même contexte sur votre Mac de 16 Go puis dans l’environnement mieux doté. Notez :

  • le résultat de ollama ps ;
  • la pression mémoire ;
  • la tendance de Swap Used ;
  • le temps avant la première sortie ;
  • la capacité à terminer la tâche ;
  • la stabilité après plusieurs tours.

Cette méthode est plus fiable qu’une comparaison visuelle entre deux réponses. Elle sépare la capacité du modèle de la capacité réelle de la machine à le maintenir en mémoire.

Choix final selon votre usage

Qwen3.8-27B doit-il être remplacé par un modèle plus petit ou exécuté sur un Mac plus puissant ?

Choisissez un modèle plus petit si vous cherchez surtout à tester des prompts, générer quelques fonctions, résumer des notes ou automatiser une tâche courte. Le Mac de 16 Go reste alors un poste polyvalent.

Choisissez un Mac avec davantage de mémoire unifiée si vous avez besoin de conserver Qwen3.8-27B pour du code agentique, de l’analyse documentaire longue, de la vision ou des sessions répétées. Pour un besoin ponctuel, la location permet de faire un essai contrôlé avant de décider d’une mise à niveau matérielle.

Votre configuration actuelle présente trois limites concrètes : le paquet du modèle dépasse déjà la mémoire physique annoncée, le système doit partager cette mémoire avec macOS et les applications, et l’échange disque peut transformer une réponse techniquement possible en outil inutilisable. Les réglages peuvent réduire le cache, mais ils ne corrigent pas ces contraintes structurelles.

Après le test court, notez donc l’état de chargement et l’évolution de l’échange. Si votre Mac de 16 Go ne termine toujours pas la tâche dans des conditions acceptables, le choix le plus propre consiste à reproduire le même protocole sur un Mac distant mieux doté avec MacHTML. Vous pourrez alors décider, sur des mesures comparables, entre un modèle plus petit, une location ponctuelle ou l’achat d’une machine locale adaptée.

Testez Qwen3.8-27B dans un environnement Mac dédié

Avec MacHTML, louez un Mac mini M4 physique et réservé à vos essais de modèles locaux. Déportez vos expérimentations vers le cloud pour préserver les ressources de votre Mac 16 Go. Accédez à votre machine à distance avec une connexion sécurisée et une bande passante dédiée de 1 Gbit/s. Choisissez une location à la journée, à la semaine, au mois ou au trimestre selon la durée de votre projet.

Louer un Mac mini cloud
Mac cloud Apple Silicon