-
Notifications
You must be signed in to change notification settings - Fork 1
Expand file tree
/
Copy pathdocker-compose.yml
More file actions
114 lines (110 loc) · 4.22 KB
/
Copy pathdocker-compose.yml
File metadata and controls
114 lines (110 loc) · 4.22 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
services:
qdrant:
image: qdrant/qdrant:v1.17.1
container_name: opencortex-qdrant
ports:
- "6333:6333"
- "6334:6334"
volumes:
- ./.cortex/qdrant:/qdrant/storage
restart: unless-stopped
vllm-embedding:
image: ${VLLM_IMAGE:-vllm/vllm-openai-cpu:latest-x86_64}
container_name: opencortex-vllm-embedding
ports:
- "18081:8000"
environment:
- HUGGING_FACE_HUB_TOKEN=${HUGGING_FACE_HUB_TOKEN:-}
- HTTP_PROXY=${HTTP_PROXY:-}
- HTTPS_PROXY=${HTTPS_PROXY:-}
- NO_PROXY=${NO_PROXY:-localhost,127.0.0.1,qdrant,opencortex,vllm-embedding,vllm-reranker}
command:
- ${VLLM_EMBEDDING_MODEL:-Qwen/Qwen3-Embedding-0.6B}
- --served-model-name
- ${VLLM_EMBEDDING_MODEL_ALIAS:-qwen3-embedding-0.6b}
- --host
- 0.0.0.0
- --port
- "8000"
- --dtype
- auto
- --gpu-memory-utilization
- ${VLLM_EMBEDDING_MEMORY_UTILIZATION:-0.35}
- --max-model-len
- ${VLLM_EMBEDDING_MAX_MODEL_LEN:-8192}
volumes:
- ./.cache/huggingface:/root/.cache/huggingface
restart: unless-stopped
vllm-reranker:
image: ${VLLM_IMAGE:-vllm/vllm-openai-cpu:latest-x86_64}
container_name: opencortex-vllm-reranker
ports:
- "18082:8000"
environment:
- HUGGING_FACE_HUB_TOKEN=${HUGGING_FACE_HUB_TOKEN:-}
- HTTP_PROXY=${HTTP_PROXY:-}
- HTTPS_PROXY=${HTTPS_PROXY:-}
- NO_PROXY=${NO_PROXY:-localhost,127.0.0.1,qdrant,opencortex,vllm-embedding,vllm-reranker}
command:
- ${VLLM_RERANK_MODEL:-Qwen/Qwen3-Reranker-0.6B}
- --served-model-name
- ${VLLM_RERANK_MODEL_ALIAS:-qwen3-reranker-0.6b}
- --host
- 0.0.0.0
- --port
- "8000"
- --dtype
- auto
- --gpu-memory-utilization
- ${VLLM_RERANK_MEMORY_UTILIZATION:-0.35}
- --max-model-len
- ${VLLM_RERANK_MAX_MODEL_LEN:-8192}
volumes:
- ./.cache/huggingface:/root/.cache/huggingface
restart: unless-stopped
opencortex:
build: .
container_name: opencortex-server
ports:
- "8921:8921"
depends_on:
- qdrant
volumes:
- ./.cortex:/data
environment:
# ---- Server ----
- OPENCORTEX_APP_APP_NAME=OpenCortex
# ---- Storage ----
- OPENCORTEX_APP_DATA_ROOT=/data
- OPENCORTEX_APP_QDRANT_URL=http://qdrant:6333
- OPENCORTEX_APP_QDRANT_API_KEY=${QDRANT_API_KEY:-}
- OPENCORTEX_APP_QDRANT_TIMEOUT=${OPENCORTEX_APP_QDRANT_TIMEOUT:-30}
# ---- Embedding: vLLM OpenAI-compatible /v1/embeddings ----
- OPENCORTEX_APP_VECTOR_DIMENSION=${VLLM_EMBEDDING_DIMENSION:-1024}
- OPENCORTEX_APP_EMBEDDING_MODEL=${VLLM_EMBEDDING_MODEL_ALIAS:-qwen3-embedding-0.6b}
- OPENCORTEX_APP_EMBEDDING_API_KEY=${VLLM_API_KEY:-opencortex-local}
- OPENCORTEX_APP_EMBEDDING_API_BASE=${OPENCORTEX_APP_EMBEDDING_API_BASE:-http://vllm-embedding:8000/v1}
# ---- LLM (required for insights generation) ----
- OPENCORTEX_APP_LLM_MODEL=${OPENCORTEX_APP_LLM_MODEL:-gpt-4o-mini}
- OPENCORTEX_APP_LLM_API_KEY=${OPENCORTEX_APP_LLM_API_KEY:-}
- OPENCORTEX_APP_LLM_API_BASE=${OPENCORTEX_APP_LLM_API_BASE:-https://api.openai.com/v1}
- OPENCORTEX_APP_LLM_API_STYLE=${OPENCORTEX_APP_LLM_API_STYLE:-openai}
# ---- Rerank ----
- OPENCORTEX_APP_RETRIEVAL_RERANK_ENABLED=${OPENCORTEX_APP_RETRIEVAL_RERANK_ENABLED:-true}
- OPENCORTEX_APP_RETRIEVAL_RERANK_PROVIDER=${OPENCORTEX_APP_RETRIEVAL_RERANK_PROVIDER:-hosted_vllm}
- OPENCORTEX_APP_RETRIEVAL_RERANK_MODEL=${VLLM_RERANK_MODEL_ALIAS:-qwen3-reranker-0.6b}
- OPENCORTEX_APP_RETRIEVAL_RERANK_API_KEY=${VLLM_API_KEY:-opencortex-local}
- OPENCORTEX_APP_RETRIEVAL_RERANK_API_BASE=${OPENCORTEX_APP_RETRIEVAL_RERANK_API_BASE:-http://vllm-reranker:8000/v1}
- OPENCORTEX_APP_RETRIEVAL_RERANK_SEED_LIMIT=${OPENCORTEX_APP_RETRIEVAL_RERANK_SEED_LIMIT:-30}
- OPENCORTEX_APP_RETRIEVAL_RERANK_FINAL_LIMIT=${OPENCORTEX_APP_RETRIEVAL_RERANK_FINAL_LIMIT:-30}
# ---- Auth ----
- OPENCORTEX_APP_ADMIN_API_TOKEN=${OPENCORTEX_APP_ADMIN_API_TOKEN:-}
restart: unless-stopped
opencortex-web:
build: ./web
container_name: opencortex-web
ports:
- "8080:80"
depends_on:
- opencortex
restart: unless-stopped