CosmicAC Logo

Recommended model parameters

Recommended model master values for each supported Managed Inference model.

CosmicAC recommends these values for each supported model's model master.

Qwen3-VL-235B-A22B-Thinking-FP8

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameQwen/Qwen3-VL-235B-A22B-Thinking-FP8
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel8
per_replica_gpu_count8
gpu_memory_utilisation0.9
max_model_length131072
max_concurrent_sequences64
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

Qwen3.5-122B-A10B

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameQwen/Qwen3.5-122B-A10B
runtime_imagevllm/vllm-openai:v0.17.1
data_typeAuto
quantisationFP8
tensor_parallel8
per_replica_gpu_count8
gpu_memory_utilisation0.9
max_model_length32768
max_concurrent_sequences32
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

MiniMax M2.5

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb500
cuda_driver_versionCUDA 13.0
model_nameMiniMaxAI/MiniMax-M2.5
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel4
per_replica_gpu_count4
gpu_memory_utilisation0.85
max_model_length27000
max_concurrent_sequences256
reasoning_parserdeepseek_r1
multimodaltrue
replica1
require_auth_headertrue
min["base_os_image"]
max["gpu_memory_utilisation"]
inference_param_overrides.root_disk_size_gb500
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENABLE_EXPERT_PARALLELtrue
inference_param_overrides.env.ENFORCE_EAGERfalse

Qwen2-VL-2B-Instruct

FieldValue
job_typeINFERENCE_VLLM
base_os_imageUbuntu 22.04 + CUDA 13.0
disk_gb150
cuda_driver_versionCUDA 13.0
ssh_public_keynull
model_nameQwen/Qwen2-VL-2B-Instruct
runtime_imagevllm/vllm-openai:v0.15.1
data_typeAuto
quantisationnull
tensor_parallel1
gpu_memory_utilisation0.9
max_model_length32768
max_concurrent_sequences64
reasoning_parserdefault
multimodaltrue
replica1
per_replica_gpu_count1
require_auth_headertrue
inference_param_overrides.root_disk_size_gb150
inference_param_overrides.env.TRUST_REMOTE_CODEtrue
inference_param_overrides.env.SWAP_SPACE0
inference_param_overrides.env.ENFORCE_EAGERfalse
min["base_os_image"]
max["gpu_memory_utilisation"]

Parakeet

The Parakeet model master stores a different set of fields. Parakeet Managed Inference parameters defines each one.

FieldValue
job_typeINFERENCE_PARAKEET
model_namenvidia/parakeet-tdt-0.6b-v3
require_auth_headerfalse
chunk_duration30
chunk_overlap5
max_file_size_mb1024
disk_gb250
replica1
inference_param_overrides.root_disk_size_gb150
inference_param_overrides.env.MODEL_SOURCEhuggingface
inference_param_overrides.env.HF_HOME/mnt/external-disk/huggingface
inference_param_overrides.env.NEMO_CACHE_DIR/mnt/external-disk/nemo
inference_param_overrides.env.HOST0.0.0.0
inference_param_overrides.env.INFERENCE_BACKENDparakeet
inference_param_overrides.env.PORT8777
inference_param_overrides.env.PARAKEET_STARTUP_TIMEOUT_MS600000

What's next

On this page