-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathconfig.example.yaml
More file actions
88 lines (77 loc) · 2.69 KB
/
Copy pathconfig.example.yaml
File metadata and controls
88 lines (77 loc) · 2.69 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
# Model Manager configuration
#
# Copy to config.local.yaml and edit to override defaults.
# Values shown here are the defaults from config.py.
# Ollama connection for local models
OLLAMA_BASE_URL: "http://localhost:11434"
# Remote providers
REMOTE_MODELS: []
# Example:
# REMOTE_MODELS:
# - name: "openrouter/anthropic/claude-sonnet-4.6"
# provider: "openrouter"
# upstream_model: "anthropic/claude-sonnet-4.6"
# capabilities: ["text"]
# family: "claude"
# parameter_size: "remote"
# metadata:
# label: "Claude Sonnet 4.6 via OpenRouter"
# - name: "zai/glm-5"
# provider: "zai"
# upstream_model: "glm-5"
# capabilities: ["text", "code", "tools"]
# family: "glm"
# parameter_size: "remote"
# metadata:
# label: "GLM-5 via Z.AI coding endpoint"
# - name: "openrouter/z-ai/glm-5"
# provider: "openrouter"
# upstream_model: "z-ai/glm-5"
# capabilities: ["text", "code", "tools"]
# family: "glm"
# parameter_size: "remote"
# metadata:
# label: "GLM-5 via OpenRouter"
# - name: "openrouter/z-ai/glm-5.1"
# provider: "openrouter"
# upstream_model: "z-ai/glm-5.1"
# capabilities: ["text", "code", "tools"]
# family: "glm"
# parameter_size: "remote"
# metadata:
# label: "GLM-5.1 via OpenRouter"
OPENROUTER_BASE_URL: "https://openrouter.ai/api/v1"
OPENROUTER_API_KEY: ""
OPENROUTER_API_KEY_FILE: ""
OPENROUTER_API_KEYS_JSON: ""
OPENROUTER_TIMEOUT_SECONDS: 180
OPENROUTER_TEMPERATURE: 0.2
OPENROUTER_MAX_TOKENS: 1024
OPENROUTER_HTTP_REFERER: ""
OPENROUTER_X_TITLE: "model-manager"
ZAI_BASE_URL: "https://api.z.ai/api/coding/paas/v4"
ZAI_API_KEY: ""
ZAI_API_KEY_FILE: ""
ZAI_API_KEYS_JSON: ""
ZAI_TIMEOUT_SECONDS: 180
ZAI_TEMPERATURE: 0.2
ZAI_MAX_TOKENS: 1024
# VRAM management (applies to local models only)
VRAM_SAFETY_MARGIN_MB: 1024 # Reserve 1 GB of VRAM headroom
VRAM_ESTIMATION_MULTIPLIER: 1.3 # Multiply model size by this for initial VRAM estimate
# Model management
MODEL_KEEP_ALIVE: 300 # Seconds to keep local models loaded after last use
MAX_CONCURRENT_PER_MODEL: 20 # Max concurrent requests per loaded model
# Scheduler
SCHEDULER_STRATEGY: "demand_based" # Options: greedy, priority_first, demand_based, balanced
SCHEDULER_LOOP_INTERVAL: 0.1 # Seconds between scheduler ticks
# Resource monitoring
MONITOR_POLL_INTERVAL: 2 # Seconds between GPU stat polls
# Queue
QUEUE_MAX_SIZE: 1000 # Maximum number of queued jobs
# HTTP API
HTTP_HOST: "127.0.0.1" # Bind host for the Flask HTTP API
http_port: 5000 # Port for the Flask HTTP API
# Storage (auto-detected for your platform, uncomment to override)
# data_dir:
# cache_dir: