CMVR-AI-ANALYSIS/deploy/compose.sglang.yaml
lixiaolong b386f003a0 feat(vision): 集成Qwen3.8视觉模型并优化音视频分析功能
- 集成Qwen3.8-27B-FP8快速模型和Qwen3.8-27B精确模型作为SGLang服务
- 添加SGLang API配置选项(SGLANG_FAST_BASE_URL、SGLANG_ACCURATE_BASE_URL等)
- 实现音频分类中的决策聚合算法(topK、nearestWeight、labelMaxDistance)
- 添加视频采样帧限制(VIDEO_SAMPLING_FRAME_LIMIT)和上下文token限制
- 更新健康检查以监控SGLang服务状态
- 实现视频分析的双模式决策策略(快速+精确)
- 添加音频参考文件导入工具(import_audio_references.py)
- 扩展音频分类标签支持FIND_VEHICLE_HORN类别
- 优化视频分析的帧采样策略,始终包含视频尾部帧
- 添加决策策略参数(tuning、decisionPolicy)支持
- 更新配置类以支持新的SGLang和视频参数
- 修改compose配置以支持Qwen3.8模型部署
- 更新音频分类测试用例验证聚合逻辑
- 重构视频测试以支持SGLang API格式和决策策略
2026-08-19 09:28:53 +08:00

83 lines
1.9 KiB
YAML

services:
qwen38-fast:
container_name: cmvr-qwen38-fast
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
restart: unless-stopped
ipc: host
shm_size: 32gb
ports:
- "192.168.28.10:14081:30000"
environment:
SGLANG_USE_MODELSCOPE: "true"
MODELSCOPE_CACHE: /root/.cache/modelscope
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
volumes:
- ../models/modelscope:/root/.cache/modelscope
gpus:
- driver: nvidia
device_ids: ["2"]
capabilities: [gpu]
command:
- python
- -m
- sglang.launch_server
- --model-path
- Qwen/Qwen3.8-27B-FP8
- --served-model-name
- Qwen/Qwen3.8-27B-FP8
- --host
- 0.0.0.0
- --port
- "30000"
- --tp-size
- "1"
- --context-length
- "262144"
- --kv-cache-dtype
- fp8_e4m3
- --mem-fraction-static
- "0.88"
- --reasoning-parser
- qwen3
qwen38-accurate:
container_name: cmvr-qwen38-accurate
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
restart: unless-stopped
ipc: host
shm_size: 32gb
ports:
- "192.168.28.10:14082:30000"
environment:
SGLANG_USE_MODELSCOPE: "true"
MODELSCOPE_CACHE: /root/.cache/modelscope
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
volumes:
- ../models/modelscope:/root/.cache/modelscope
gpus:
- driver: nvidia
device_ids: ["3"]
capabilities: [gpu]
command:
- python
- -m
- sglang.launch_server
- --model-path
- Qwen/Qwen3.8-27B
- --served-model-name
- Qwen/Qwen3.8-27B
- --host
- 0.0.0.0
- --port
- "30000"
- --tp-size
- "1"
- --context-length
- "262144"
- --kv-cache-dtype
- fp8_e4m3
- --mem-fraction-static
- "0.92"
- --reasoning-parser
- qwen3