064b06ecf0
迁入 app/park:llm(对话)、rag(双路向量知识库)、tools/ai_tools(智能体工具)、 asr(语音识别)、s2s_bridge(实时语音桥)、vision_yolo/vision_llm(人脸/多模态)、 knowledge/*.md、vendor/s2s-cloud(s2s 云化栈);routers 补 /api/ai|kb|asr|vision| s2s|tools 端点。智能体提示词/企业名录改读 park_config 主数据源。pyproject 加重依赖 (dashscope/numpy/openai/torch/transformers/ultralytics/websockets/soundfile/scipy/ nltk/jinja2)。TestClient 冒烟:ai/chat(无 Key 走本地规则)、kb、s2s、tools、display 均 200。
73 lines
1.4 KiB
YAML
73 lines
1.4 KiB
YAML
---
|
|
services:
|
|
|
|
llama:
|
|
image: ghcr.io/ggml-org/llama.cpp:server-cuda
|
|
command:
|
|
- -hf
|
|
- ggml-org/gemma-4-E4B-it-GGUF
|
|
- -np
|
|
- "2"
|
|
- -c
|
|
- "65536"
|
|
- -fa
|
|
- "on"
|
|
- --swa-full
|
|
- --host
|
|
- 0.0.0.0
|
|
- --port
|
|
- "8080"
|
|
ports:
|
|
- 8080:8080/tcp
|
|
volumes:
|
|
- ./cache/:/root/.cache/
|
|
deploy:
|
|
resources:
|
|
reservations:
|
|
devices:
|
|
- driver: nvidia
|
|
device_ids: ['0']
|
|
capabilities: [gpu]
|
|
|
|
pipeline:
|
|
depends_on:
|
|
- llama
|
|
build:
|
|
context: .
|
|
dockerfile: ${DOCKERFILE:-Dockerfile}
|
|
command:
|
|
- speech-to-speech
|
|
- --mode
|
|
- socket
|
|
- --recv_host
|
|
- 0.0.0.0
|
|
- --send_host
|
|
- 0.0.0.0
|
|
- --llm_backend
|
|
- responses-api
|
|
- --model_name
|
|
- ggml-org/gemma-4-E4B-it-GGUF
|
|
- --responses_api_base_url
|
|
- http://llama:8080/v1
|
|
- --responses_api_api_key
|
|
- ""
|
|
- --init_chat_role
|
|
- system
|
|
- --init_chat_prompt
|
|
- "You are a helpful assistant"
|
|
expose:
|
|
- 12345/tcp
|
|
- 12346/tcp
|
|
ports:
|
|
- 12345:12345/tcp
|
|
- 12346:12346/tcp
|
|
volumes:
|
|
- ./cache/:/root/.cache/
|
|
deploy:
|
|
resources:
|
|
reservations:
|
|
devices:
|
|
- driver: nvidia
|
|
device_ids: ['0']
|
|
capabilities: [gpu]
|