models.ini used:
[jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus]
model = /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf
chat-template-file = /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualutyPlus/step37-native-tool-response-template.jinja
ctx-size = 262144
temp = 1.0
top-p = 0.95
top-k = 20
min-p = 0.0
repeat-penalty = 1.0
spec-type = draft-mtp
device = Vulkan0
spec-draft-device = Vulkan0
cache-type-k = q8_0
cache-type-v = q8_0
spec-draft-type-k = q8_0
spec-draft-type-v = q8_0
spec-draft-ngl = all
spec-draft-n-max = 2
spec-draft-n-min = 0
spec-draft-p-min = 0.75
spec-draft-p-split = 0.10
[56347] 0.00.337.397 I srv main: loading model
[56347] 0.00.337.401 I srv load_model: loading model '/mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf'
[56347] 0.00.362.479 I llama_model_loader: additional 8 GGUFs metadata loaded.
[56347] 0.00.362.498 I llama_model_loader: loaded meta data with 49 key-value pairs and 754 tensors from /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf (version GGUF V3 (latest))
[56347] 0.00.362.522 I llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
[56347] 0.00.362.533 I llama_model_loader: - kv 0: general.architecture str = step35
[56347] 0.00.362.534 I llama_model_loader: - kv 1: general.type str = model
[56347] 0.00.362.535 I llama_model_loader: - kv 2: general.name str = Step-3.7
[56347] 0.00.362.535 I llama_model_loader: - kv 3: general.size_label str = 288x7.4B
[56347] 0.00.362.540 I llama_model_loader: - kv 4: step35.block_count u32 = 45
[56347] 0.00.362.540 I llama_model_loader: - kv 5: step35.context_length u32 = 262144
[56347] 0.00.362.541 I llama_model_loader: - kv 6: step35.embedding_length u32 = 4096
[56347] 0.00.362.541 I llama_model_loader: - kv 7: step35.feed_forward_length u32 = 11264
[56347] 0.00.362.566 I llama_model_loader: - kv 8: step35.attention.head_count arr[i32,45] = [64, 96, 96, 96, 64, 96, 96, 96, 64, ...
[56347] 0.00.362.575 I llama_model_loader: - kv 9: step35.rope.freq_base f32 = 5000000.000000
[56347] 0.00.362.576 I llama_model_loader: - kv 10: step35.rope.freq_base_swa f32 = 10000.000000
[56347] 0.00.362.577 I llama_model_loader: - kv 11: step35.expert_gating_func u32 = 2
[56347] 0.00.362.577 I llama_model_loader: - kv 12: step35.attention.key_length u32 = 128
[56347] 0.00.362.577 I llama_model_loader: - kv 13: step35.attention.value_length u32 = 128
[56347] 0.00.362.581 I llama_model_loader: - kv 14: step35.attention.head_count_kv arr[i32,45] = [8, 8, 8, 8, 8, 8, 8, 8, 8, 8, 8, 8, ...
[56347] 0.00.362.581 I llama_model_loader: - kv 15: step35.attention.sliding_window u32 = 512
[56347] 0.00.362.584 I llama_model_loader: - kv 16: step35.attention.sliding_window_pattern arr[bool,45] = [false, true, true, true, false, true...
[56347] 0.00.362.585 I llama_model_loader: - kv 17: step35.expert_count u32 = 288
[56347] 0.00.362.585 I llama_model_loader: - kv 18: step35.expert_used_count u32 = 8
[56347] 0.00.362.586 I llama_model_loader: - kv 19: step35.expert_feed_forward_length u32 = 1280
[56347] 0.00.362.586 I llama_model_loader: - kv 20: step35.expert_shared_feed_forward_length u32 = 1280
[56347] 0.00.362.587 I llama_model_loader: - kv 21: step35.expert_weights_scale f32 = 3.000000
[56347] 0.00.362.587 I llama_model_loader: - kv 22: step35.expert_weights_norm bool = true
[56347] 0.00.362.588 I llama_model_loader: - kv 23: step35.leading_dense_block_count u32 = 3
[56347] 0.00.362.588 I llama_model_loader: - kv 24: step35.moe_every_n_layers u32 = 1
[56347] 0.00.362.589 I llama_model_loader: - kv 25: step35.attention.layer_norm_rms_epsilon f32 = 0.000010
[56347] 0.00.362.596 I llama_model_loader: - kv 26: step35.swiglu_clamp_exp arr[f32,45] = [0.000000, 0.000000, 0.000000, 0.0000...
[56347] 0.00.362.604 I llama_model_loader: - kv 27: step35.swiglu_clamp_shexp arr[f32,45] = [0.000000, 0.000000, 0.000000, 0.0000...
[56347] 0.00.362.604 I llama_model_loader: - kv 28: tokenizer.ggml.model str = gpt2
[56347] 0.00.362.604 I llama_model_loader: - kv 29: tokenizer.ggml.pre str = deepseek-v3
[56347] 0.00.375.002 I llama_model_loader: - kv 30: tokenizer.ggml.tokens arr[str,128896] = ["<|begin▁of▁sentence|>", "<�...
[56347] 0.00.377.837 I llama_model_loader: - kv 31: tokenizer.ggml.token_type arr[i32,128896] = [3, 3, 3, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
[56347] 0.00.388.195 I llama_model_loader: - kv 32: tokenizer.ggml.merges arr[str,127741] = ["Ġ t", "Ġ a", "i n", "Ġ Ġ", "h e...
[56347] 0.00.388.234 I llama_model_loader: - kv 33: tokenizer.ggml.bos_token_id u32 = 0
[56347] 0.00.388.253 I llama_model_loader: - kv 34: tokenizer.ggml.eos_token_id u32 = 128007
[56347] 0.00.388.269 I llama_model_loader: - kv 35: tokenizer.ggml.padding_token_id u32 = 1
[56347] 0.00.388.284 I llama_model_loader: - kv 36: tokenizer.ggml.add_bos_token bool = true
[56347] 0.00.388.312 I llama_model_loader: - kv 37: tokenizer.ggml.add_sep_token bool = false
[56347] 0.00.388.338 I llama_model_loader: - kv 38: tokenizer.ggml.add_eos_token bool = false
[56347] 0.00.388.365 I llama_model_loader: - kv 39: tokenizer.chat_template str = {% macro render_message_content(messa...
[56347] 0.00.388.366 I llama_model_loader: - kv 40: general.quantization_version u32 = 2
[56347] 0.00.388.366 I llama_model_loader: - kv 41: general.file_type u32 = 112
[56347] 0.00.388.367 I llama_model_loader: - kv 42: quantize.imatrix.file str = /srv/ssd/sn850x/models/stepfun-ai/Ste...
[56347] 0.00.388.368 I llama_model_loader: - kv 43: quantize.imatrix.dataset str = /mnt/lvyichen/step3.6_final_model_bf1...
[56347] 0.00.388.369 I llama_model_loader: - kv 44: quantize.imatrix.entries_count u32 = 528
[56347] 0.00.388.369 I llama_model_loader: - kv 45: quantize.imatrix.chunks_count u32 = 4868
[56347] 0.00.388.370 I llama_model_loader: - kv 46: split.no u16 = 0
[56347] 0.00.388.370 I llama_model_loader: - kv 47: split.count u16 = 9
[56347] 0.00.388.371 I llama_model_loader: - kv 48: split.tensors.count i32 = 754
[56347] 0.00.388.375 I llama_model_loader: - type f32: 266 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q4_K: 90 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q5_K: 225 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q4_0_rocmfp4_fast: 2 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q3_0_rocmfpx: 171 tensors
[56347] 0.00.388.381 I print_info: file format = GGUF V3 (latest)
[56347] 0.00.388.381 I print_info: file type = Q3_0_ROCMFPX
[56347] 0.00.388.387 I print_info: file size = 81.76 GiB (3.57 BPW)
[56347] 0.00.388.600 I llama_prepare_model_devices: using device Vulkan0 (Radeon 8060S Graphics (RADV GFX1151)) (0000:c5:00.0) - 127289 MiB free
[56347] 0.00.440.234 I load: 0 unused tokens
[56347] 0.00.450.882 I load: printing all EOG tokens:
[56347] 0.00.450.885 I load: - 1 ('<|end▁of▁sentence|>')
[56347] 0.00.450.886 I load: - 128007 ('<|im_end|>')
[56347] 0.00.451.103 I load: special tokens cache size = 818
[56347] 0.00.483.257 I load: token to piece cache size = 0.8220 MB
[56347] 0.00.483.297 I print_info: arch = step35
[56347] 0.00.483.298 I print_info: vocab_only = 0
[56347] 0.00.483.298 I print_info: no_alloc = 0
[56347] 0.00.483.298 I print_info: n_ctx_train = 262144
[56347] 0.00.483.299 I print_info: n_embd = 4096
[56347] 0.00.483.301 I print_info: n_embd_inp = 4096
[56347] 0.00.483.301 I print_info: n_layer = 45
[56347] 0.00.483.323 I print_info: n_head = [64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64]
[56347] 0.00.483.326 I print_info: n_head_kv = 8
[56347] 0.00.483.326 I print_info: n_rot = 64
[56347] 0.00.483.327 I print_info: n_swa = 512
[56347] 0.00.483.329 I print_info: is_swa_any = 1
[56347] 0.00.483.329 I print_info: n_embd_head_k = 128
[56347] 0.00.483.330 I print_info: n_embd_head_v = 128
[56347] 0.00.483.334 I print_info: n_gqa = [8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8]
[56347] 0.00.483.340 I print_info: n_embd_k_gqa = 1024
[56347] 0.00.483.344 I print_info: n_embd_v_gqa = 1024
[56347] 0.00.483.345 I print_info: f_norm_eps = 0.0e+00
[56347] 0.00.483.346 I print_info: f_norm_rms_eps = 1.0e-05
[56347] 0.00.483.346 I print_info: f_clamp_kqv = 0.0e+00
[56347] 0.00.483.347 I print_info: f_max_alibi_bias = 0.0e+00
[56347] 0.00.483.347 I print_info: f_logit_scale = 0.0e+00
[56347] 0.00.483.347 I print_info: f_attn_scale = 0.0e+00
[56347] 0.00.483.348 I print_info: f_attn_value_scale = 0.0000
[56347] 0.00.483.350 I print_info: n_ff = 11264
[56347] 0.00.483.351 I print_info: n_expert = 288
[56347] 0.00.483.351 I print_info: n_expert_used = 8
[56347] 0.00.483.351 I print_info: n_expert_groups = 0
[56347] 0.00.483.351 I print_info: n_group_used = 0
[56347] 0.00.483.351 I print_info: causal attn = 1
[56347] 0.00.483.352 I print_info: pooling type = -1
[56347] 0.00.483.352 I print_info: rope type = 2
[56347] 0.00.483.352 I print_info: rope scaling = linear
[56347] 0.00.483.354 I print_info: freq_base_train = 5000000.0
[56347] 0.00.483.354 I print_info: freq_scale_train = 1
[56347] 0.00.483.355 I print_info: freq_base_swa = 10000.0
[56347] 0.00.483.355 I print_info: freq_scale_swa = 1
[56347] 0.00.483.355 I print_info: n_embd_head_k_swa = 128
[56347] 0.00.483.356 I print_info: n_embd_head_v_swa = 128
[56347] 0.00.483.356 I print_info: n_rot_swa = 128
[56347] 0.00.483.356 I print_info: n_ctx_orig_yarn = 262144
[56347] 0.00.483.356 I print_info: rope_yarn_log_mul = 0.0000
[56347] 0.00.483.357 I print_info: rope_finetuned = unknown
[56347] 0.00.483.358 I print_info: model type = 196B.A11B
[56347] 0.00.483.359 I print_info: model params = 196.96 B
[56347] 0.00.483.359 I print_info: general.name = Step-3.7
[56347] 0.00.483.364 I print_info: vocab type = BPE
[56347] 0.00.483.367 I print_info: n_vocab = 128896
[56347] 0.00.483.367 I print_info: n_merges = 127741
[56347] 0.00.483.368 I print_info: BOS token = 0 '<|begin▁of▁sentence|>'
[56347] 0.00.483.368 I print_info: EOS token = 128007 '<|im_end|>'
[56347] 0.00.483.368 I print_info: EOT token = 128007 '<|im_end|>'
[56347] 0.00.483.369 I print_info: PAD token = 1 '<|end▁of▁sentence|>'
[56347] 0.00.483.369 I print_info: LF token = 201 'Ċ'
[56347] 0.00.483.369 I print_info: FIM PRE token = 128801 '<|fim▁begin|>'
[56347] 0.00.483.369 I print_info: FIM SUF token = 128800 '<|fim▁hole|>'
[56347] 0.00.483.370 I print_info: FIM MID token = 128802 '<|fim▁end|>'
[56347] 0.00.483.370 I print_info: EOG token = 1 '<|end▁of▁sentence|>'
[56347] 0.00.483.371 I print_info: EOG token = 128007 '<|im_end|>'
[56347] 0.00.483.371 I print_info: max token length = 256
[56347] 0.00.483.374 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = true)
[56347] 0.04.960.316 I load_tensors: offloading output layer to GPU
[56347] 0.04.960.320 I load_tensors: offloading 44 repeating layers to GPU
[56347] 0.04.960.320 I load_tensors: offloaded 46/46 layers to GPU
[56347] 0.04.960.332 I load_tensors: Vulkan0 model buffer size = 83458.60 MiB
[56347] 0.04.960.333 I load_tensors: Vulkan_Host model buffer size = 267.48 MiB
[56347] ....................................................................................................
[56347] 0.35.012.618 I common_init_result: added <|end▁of▁sentence|> logit bias = -inf
[56347] 0.35.013.530 I common_init_result: added <|im_end|> logit bias = -inf
[56347] 0.35.013.682 I llama_context: constructing llama_context
[56347] 0.35.013.690 I llama_context: n_seq_max = 1
[56347] 0.35.013.691 I llama_context: n_ctx = 262144
[56347] 0.35.013.691 I llama_context: n_ctx_seq = 262144
[56347] 0.35.013.692 I llama_context: n_batch = 32768
[56347] 0.35.013.692 I llama_context: n_ubatch = 2048
[56347] 0.35.013.693 I llama_context: causal_attn = 1
[56347] 0.35.013.694 I llama_context: flash_attn = enabled
[56347] 0.35.013.695 I llama_context: kv_unified = false
[56347] 0.35.013.702 I llama_context: freq_base = 5000000.0
[56347] 0.35.013.703 I llama_context: freq_scale = 1
[56347] 0.35.013.704 I llama_context: n_rs_seq = 0
[56347] 0.35.013.915 I llama_context: Vulkan_Host output buffer size = 0.49 MiB
[56347] 0.35.014.793 I llama_kv_cache_iswa: creating non-SWA KV cache, size = 262144 cells
[56347] 0.35.527.653 I llama_kv_cache: Vulkan0 KV buffer size = 6528.00 MiB
[56347] 0.36.074.391 I llama_kv_cache: size = 6528.00 MiB (262144 cells, 12 layers, 1/1 seqs), K (q8_0): 3264.00 MiB, V (q8_0): 3264.00 MiB
[56347] 0.36.074.403 I llama_kv_cache: attn_rot_k = 1, n_embd_head_k_all = 128
[56347] 0.36.074.404 I llama_kv_cache: attn_rot_v = 1, n_embd_head_k_all = 128
[56347] 0.36.074.424 I llama_kv_cache_iswa: creating SWA KV cache, size = 2560 cells
[56347] 0.36.074.691 I llama_kv_cache: Vulkan0 KV buffer size = 175.31 MiB
[56347] 0.36.089.912 I llama_kv_cache: size = 175.31 MiB ( 2560 cells, 33 layers, 1/1 seqs), K (q8_0): 87.66 MiB, V (q8_0): 87.66 MiB
[56347] 0.36.090.553 I llama_kv_cache: attn_rot_k = 1, n_embd_head_k_all = 128
[56347] 0.36.090.573 I llama_kv_cache: attn_rot_v = 1, n_embd_head_k_all = 128
[56347] 0.36.090.626 I sched_reserve: reserving ...
[56347] 0.36.091.944 I sched_reserve: resolving fused Gated Delta Net support:
[56347] 0.36.094.863 I sched_reserve: fused Gated Delta Net (autoregressive) enabled
[56347] 0.36.096.387 I sched_reserve: fused Gated Delta Net (chunked) enabled
[56347] 0.37.038.147 I sched_reserve: Vulkan0 compute buffer size = 3300.23 MiB
[56347] 0.37.038.158 I sched_reserve: Vulkan_Host compute buffer size = 2132.24 MiB
[56347] 0.37.038.158 I sched_reserve: graph nodes = 3874
[56347] 0.37.038.159 I sched_reserve: graph splits = 2
[56347] 0.37.038.163 I sched_reserve: reserve took 947.51 ms, sched copies = 1
[56347] 0.37.038.224 I srv load_model: creating MTP draft context against the target model '/mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf'
[56347] 0.37.038.232 W llama_init_from_model: context type MTP requested but model doesn't contain MTP layers
[56347] 0.37.038.233 E srv load_model: failed to create MTP context
[56347] 0.37.038.235 I srv operator(): operator(): cleaning up before exit...
[56347] 0.37.044.237 E srv main: exiting due to model loading error