# Comment faire tourner mini-me sur llama.cpp plutôt que Docker Model Runner Ce guide montre comment pointer `mm` vers un `llama-server` que vous démarrez vous-même. Il suppose que vous savez déjà compiler `mm` et obtenir un modèle GGUF. ## Étapes 1. Démarrez `llama-server` avec un template de chat et l'appel d'outils activé. `--jinja` est obligatoire : sans lui, le serveur refuse le paramètre `tools` et l'agent ne peut exécuter aucune commande. Donnez au modèle servi un alias avec `-a`, car `llama-server` route les requêtes sur le champ `model` : ```bash llama-server -hf jetbrains/mellum2-12b-a2.5b-instruct-gguf-q4_k_m:Q4_K_M \ -a jetbrains/mellum2-12b-a2.5b-instruct-gguf-q4_k_m:Q4_K_M \ --jinja -c 32768 --port 8080 ``` 2. Utilisez le fichier de configuration llama.cpp livré. Sa clé `model:` doit correspondre à l'alias `-a` ci-dessus : ```bash ./mm agent.llamacpp.yaml ``` 3. Vérifiez la bannière. `provider: llamacpp` confirme le fournisseur, et `ctx: 32768 (/props)` confirme que l'agent a lu la taille de contexte servie sur le point d'accès `/props` du serveur. ## Variantes - **Autre port ou autre hôte.** Mettez `baseUrl` à `http://:/v1` dans le YAML, ou surchargez pour une seule exécution avec `AGENT_BASE_URL=http://:/v1 ./mm agent.llamacpp.yaml`. Une surcharge par l'environnement est prise telle quelle, sans sonde de repli. - **Serveur démarré avec `--api-key`.** Exportez la clé dans `LLAMA_API_KEY` (la variable par défaut du fournisseur) ou nommez une autre variable dans `apiKeyEnv`. La clé elle-même ne va jamais dans le YAML. - **Garder `agent.yaml` et changer de fournisseur pour une exécution.** `AGENT_PROVIDER=llamacpp ./mm` fonctionne tant qu'`agent.yaml` laisse `baseUrl` vide ; une URL DMR explicite dans le fichier serait respectée et pointerait toujours sur le port 12434. - **Le serveur masque `/props`** (un reverse proxy, par exemple). Fixez `contextWindow` à la valeur avec laquelle vous avez démarré le serveur, sinon la bannière affiche `ctx: unknown`. ## Voir aussi - Chaque clé du fichier : [référence de la configuration](../reference/configuration.md) - Pourquoi une seule implémentation sert les deux serveurs : [fournisseurs](../explanation/providers.md)