- 集成Qwen3.8-27B-FP8快速模型和Qwen3.8-27B精确模型作为SGLang服务 - 添加SGLang API配置选项(SGLANG_FAST_BASE_URL、SGLANG_ACCURATE_BASE_URL等) - 实现音频分类中的决策聚合算法(topK、nearestWeight、labelMaxDistance) - 添加视频采样帧限制(VIDEO_SAMPLING_FRAME_LIMIT)和上下文token限制 - 更新健康检查以监控SGLang服务状态 - 实现视频分析的双模式决策策略(快速+精确) - 添加音频参考文件导入工具(import_audio_references.py) - 扩展音频分类标签支持FIND_VEHICLE_HORN类别 - 优化视频分析的帧采样策略,始终包含视频尾部帧 - 添加决策策略参数(tuning、decisionPolicy)支持 - 更新配置类以支持新的SGLang和视频参数 - 修改compose配置以支持Qwen3.8模型部署 - 更新音频分类测试用例验证聚合逻辑 - 重构视频测试以支持SGLang API格式和决策策略
83 lines
1.9 KiB
YAML
83 lines
1.9 KiB
YAML
services:
|
|
qwen38-fast:
|
|
container_name: cmvr-qwen38-fast
|
|
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
|
|
restart: unless-stopped
|
|
ipc: host
|
|
shm_size: 32gb
|
|
ports:
|
|
- "192.168.28.10:14081:30000"
|
|
environment:
|
|
SGLANG_USE_MODELSCOPE: "true"
|
|
MODELSCOPE_CACHE: /root/.cache/modelscope
|
|
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
|
|
volumes:
|
|
- ../models/modelscope:/root/.cache/modelscope
|
|
gpus:
|
|
- driver: nvidia
|
|
device_ids: ["2"]
|
|
capabilities: [gpu]
|
|
command:
|
|
- python
|
|
- -m
|
|
- sglang.launch_server
|
|
- --model-path
|
|
- Qwen/Qwen3.8-27B-FP8
|
|
- --served-model-name
|
|
- Qwen/Qwen3.8-27B-FP8
|
|
- --host
|
|
- 0.0.0.0
|
|
- --port
|
|
- "30000"
|
|
- --tp-size
|
|
- "1"
|
|
- --context-length
|
|
- "262144"
|
|
- --kv-cache-dtype
|
|
- fp8_e4m3
|
|
- --mem-fraction-static
|
|
- "0.88"
|
|
- --reasoning-parser
|
|
- qwen3
|
|
|
|
qwen38-accurate:
|
|
container_name: cmvr-qwen38-accurate
|
|
image: quay.io/gpustack/runner:cuda13.0-sglang0.5.15.post1
|
|
restart: unless-stopped
|
|
ipc: host
|
|
shm_size: 32gb
|
|
ports:
|
|
- "192.168.28.10:14082:30000"
|
|
environment:
|
|
SGLANG_USE_MODELSCOPE: "true"
|
|
MODELSCOPE_CACHE: /root/.cache/modelscope
|
|
MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS: "4"
|
|
volumes:
|
|
- ../models/modelscope:/root/.cache/modelscope
|
|
gpus:
|
|
- driver: nvidia
|
|
device_ids: ["3"]
|
|
capabilities: [gpu]
|
|
command:
|
|
- python
|
|
- -m
|
|
- sglang.launch_server
|
|
- --model-path
|
|
- Qwen/Qwen3.8-27B
|
|
- --served-model-name
|
|
- Qwen/Qwen3.8-27B
|
|
- --host
|
|
- 0.0.0.0
|
|
- --port
|
|
- "30000"
|
|
- --tp-size
|
|
- "1"
|
|
- --context-length
|
|
- "262144"
|
|
- --kv-cache-dtype
|
|
- fp8_e4m3
|
|
- --mem-fraction-static
|
|
- "0.92"
|
|
- --reasoning-parser
|
|
- qwen3
|