- 移除Ollama相关配置和回退机制,统一使用SGLang作为视觉模型提供商 - 添加IMAGE_ANALYSIS类型支持,允许对多张图片进行分析 - 实现视频分析的详细输出模式,支持紧凑和详细两种结果格式 - 更新环境变量配置,添加VIDEO_MODEL_FRAME_LIMIT和MAX_IMAGE_BYTES - 修改compose配置文件中的上下文长度和内存分配参数 - 重构视频采样逻辑,限制单次请求帧数以优化显存使用 - 更新API接口文档,添加mediaUrls参数和详细输出选项说明 - 添加图像分析相关的依赖库opencv-python-headless - 实现结构化JSON响应格式验证和重试机制
83 lines
1.9 KiB
YAML
83 lines
1.9 KiB
YAML
services:
|
|
qwen38-fast:
|
|
container_name: cmvr-qwen38-fast
|
|
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
|
|
restart: unless-stopped
|
|
ipc: host
|
|
shm_size: 32gb
|
|
ports:
|
|
- "192.168.28.10:14081:30000"
|
|
environment:
|
|
SGLANG_USE_MODELSCOPE: "true"
|
|
MODELSCOPE_CACHE: /root/.cache/modelscope
|
|
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
|
|
volumes:
|
|
- ../models/modelscope:/root/.cache/modelscope
|
|
gpus:
|
|
- driver: nvidia
|
|
device_ids: ["2"]
|
|
capabilities: [gpu]
|
|
command:
|
|
- python
|
|
- -m
|
|
- sglang.launch_server
|
|
- --model-path
|
|
- Qwen/Qwen3.8-27B-FP8
|
|
- --served-model-name
|
|
- Qwen/Qwen3.8-27B-FP8
|
|
- --host
|
|
- 0.0.0.0
|
|
- --port
|
|
- "30000"
|
|
- --tp-size
|
|
- "1"
|
|
- --context-length
|
|
- "65536"
|
|
- --kv-cache-dtype
|
|
- fp8_e4m3
|
|
- --mem-fraction-static
|
|
- "0.80"
|
|
- --reasoning-parser
|
|
- qwen3
|
|
|
|
qwen38-accurate:
|
|
container_name: cmvr-qwen38-accurate
|
|
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
|
|
restart: unless-stopped
|
|
ipc: host
|
|
shm_size: 32gb
|
|
ports:
|
|
- "192.168.28.10:14082:30000"
|
|
environment:
|
|
SGLANG_USE_MODELSCOPE: "true"
|
|
MODELSCOPE_CACHE: /root/.cache/modelscope
|
|
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
|
|
volumes:
|
|
- ../models/modelscope:/root/.cache/modelscope
|
|
gpus:
|
|
- driver: nvidia
|
|
device_ids: ["3"]
|
|
capabilities: [gpu]
|
|
command:
|
|
- python
|
|
- -m
|
|
- sglang.launch_server
|
|
- --model-path
|
|
- Qwen/Qwen3.8-27B
|
|
- --served-model-name
|
|
- Qwen/Qwen3.8-27B
|
|
- --host
|
|
- 0.0.0.0
|
|
- --port
|
|
- "30000"
|
|
- --tp-size
|
|
- "1"
|
|
- --context-length
|
|
- "65536"
|
|
- --kv-cache-dtype
|
|
- fp8_e4m3
|
|
- --mem-fraction-static
|
|
- "0.84"
|
|
- --reasoning-parser
|
|
- qwen3
|