Files
server-core/app/park/vendor/s2s-cloud/docker-compose.yml
T
Pine 064b06ecf0 feat(park): 全量迁入园区重模块 llm/rag/asr/s2s/vision + 重依赖
迁入 app/park:llm(对话)、rag(双路向量知识库)、tools/ai_tools(智能体工具)、
asr(语音识别)、s2s_bridge(实时语音桥)、vision_yolo/vision_llm(人脸/多模态)、
knowledge/*.md、vendor/s2s-cloud(s2s 云化栈);routers 补 /api/ai|kb|asr|vision|
s2s|tools 端点。智能体提示词/企业名录改读 park_config 主数据源。pyproject 加重依赖
(dashscope/numpy/openai/torch/transformers/ultralytics/websockets/soundfile/scipy/
nltk/jinja2)。TestClient 冒烟:ai/chat(无 Key 走本地规则)、kb、s2s、tools、display 均 200。
2026-08-24 17:28:53 +08:00

73 lines
1.4 KiB
YAML

---
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-cuda
command:
- -hf
- ggml-org/gemma-4-E4B-it-GGUF
- -np
- "2"
- -c
- "65536"
- -fa
- "on"
- --swa-full
- --host
- 0.0.0.0
- --port
- "8080"
ports:
- 8080:8080/tcp
volumes:
- ./cache/:/root/.cache/
deploy:
resources:
reservations:
devices:
- driver: nvidia
device_ids: ['0']
capabilities: [gpu]
pipeline:
depends_on:
- llama
build:
context: .
dockerfile: ${DOCKERFILE:-Dockerfile}
command:
- speech-to-speech
- --mode
- socket
- --recv_host
- 0.0.0.0
- --send_host
- 0.0.0.0
- --llm_backend
- responses-api
- --model_name
- ggml-org/gemma-4-E4B-it-GGUF
- --responses_api_base_url
- http://llama:8080/v1
- --responses_api_api_key
- ""
- --init_chat_role
- system
- --init_chat_prompt
- "You are a helpful assistant"
expose:
- 12345/tcp
- 12346/tcp
ports:
- 12345:12345/tcp
- 12346:12346/tcp
volumes:
- ./cache/:/root/.cache/
deploy:
resources:
reservations:
devices:
- driver: nvidia
device_ids: ['0']
capabilities: [gpu]