CMVR-AI-ANALYSIS/deploy/compose.sglang.yaml
lixiaolong 873a82b0f5 feat(service): 升级AI分析服务支持图像分析和视频详细输出
- 移除Ollama相关配置和回退机制,统一使用SGLang作为视觉模型提供商
- 添加IMAGE_ANALYSIS类型支持,允许对多张图片进行分析
- 实现视频分析的详细输出模式,支持紧凑和详细两种结果格式
- 更新环境变量配置,添加VIDEO_MODEL_FRAME_LIMIT和MAX_IMAGE_BYTES
- 修改compose配置文件中的上下文长度和内存分配参数
- 重构视频采样逻辑,限制单次请求帧数以优化显存使用
- 更新API接口文档,添加mediaUrls参数和详细输出选项说明
- 添加图像分析相关的依赖库opencv-python-headless
- 实现结构化JSON响应格式验证和重试机制
2026-08-21 16:19:35 +08:00

83 lines
1.9 KiB
YAML

services:
qwen38-fast:
container_name: cmvr-qwen38-fast
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
restart: unless-stopped
ipc: host
shm_size: 32gb
ports:
- "192.168.28.10:14081:30000"
environment:
SGLANG_USE_MODELSCOPE: "true"
MODELSCOPE_CACHE: /root/.cache/modelscope
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
volumes:
- ../models/modelscope:/root/.cache/modelscope
gpus:
- driver: nvidia
device_ids: ["2"]
capabilities: [gpu]
command:
- python
- -m
- sglang.launch_server
- --model-path
- Qwen/Qwen3.8-27B-FP8
- --served-model-name
- Qwen/Qwen3.8-27B-FP8
- --host
- 0.0.0.0
- --port
- "30000"
- --tp-size
- "1"
- --context-length
- "65536"
- --kv-cache-dtype
- fp8_e4m3
- --mem-fraction-static
- "0.80"
- --reasoning-parser
- qwen3
qwen38-accurate:
container_name: cmvr-qwen38-accurate
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
restart: unless-stopped
ipc: host
shm_size: 32gb
ports:
- "192.168.28.10:14082:30000"
environment:
SGLANG_USE_MODELSCOPE: "true"
MODELSCOPE_CACHE: /root/.cache/modelscope
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
volumes:
- ../models/modelscope:/root/.cache/modelscope
gpus:
- driver: nvidia
device_ids: ["3"]
capabilities: [gpu]
command:
- python
- -m
- sglang.launch_server
- --model-path
- Qwen/Qwen3.8-27B
- --served-model-name
- Qwen/Qwen3.8-27B
- --host
- 0.0.0.0
- --port
- "30000"
- --tp-size
- "1"
- --context-length
- "65536"
- --kv-cache-dtype
- fp8_e4m3
- --mem-fraction-static
- "0.84"
- --reasoning-parser
- qwen3