Skip to content

Instantly share code, notes, and snippets.

@rcmorano
Created July 5, 2026 16:27
Show Gist options
  • Select an option

  • Save rcmorano/14cc570bac8ca42ca238330e13bfdeb8 to your computer and use it in GitHub Desktop.

Select an option

Save rcmorano/14cc570bac8ca42ca238330e13bfdeb8 to your computer and use it in GitHub Desktop.

models.ini used:

[jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus]
model = /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf
chat-template-file = /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualutyPlus/step37-native-tool-response-template.jinja
ctx-size = 262144
temp = 1.0
top-p = 0.95
top-k = 20
min-p = 0.0
repeat-penalty = 1.0
spec-type = draft-mtp
device = Vulkan0
spec-draft-device = Vulkan0
cache-type-k = q8_0
cache-type-v = q8_0
spec-draft-type-k = q8_0
spec-draft-type-v = q8_0
spec-draft-ngl = all
spec-draft-n-max = 2
spec-draft-n-min = 0
spec-draft-p-min = 0.75
spec-draft-p-split = 0.10
[56347] 0.00.337.397 I srv          main: loading model
[56347] 0.00.337.401 I srv    load_model: loading model '/mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf'
[56347] 0.00.362.479 I llama_model_loader: additional 8 GGUFs metadata loaded.
[56347] 0.00.362.498 I llama_model_loader: loaded meta data with 49 key-value pairs and 754 tensors from /mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf (version GGUF V3 (latest))
[56347] 0.00.362.522 I llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
[56347] 0.00.362.533 I llama_model_loader: - kv   0:                       general.architecture str              = step35
[56347] 0.00.362.534 I llama_model_loader: - kv   1:                               general.type str              = model
[56347] 0.00.362.535 I llama_model_loader: - kv   2:                               general.name str              = Step-3.7
[56347] 0.00.362.535 I llama_model_loader: - kv   3:                         general.size_label str              = 288x7.4B
[56347] 0.00.362.540 I llama_model_loader: - kv   4:                         step35.block_count u32              = 45
[56347] 0.00.362.540 I llama_model_loader: - kv   5:                      step35.context_length u32              = 262144
[56347] 0.00.362.541 I llama_model_loader: - kv   6:                    step35.embedding_length u32              = 4096
[56347] 0.00.362.541 I llama_model_loader: - kv   7:                 step35.feed_forward_length u32              = 11264
[56347] 0.00.362.566 I llama_model_loader: - kv   8:                step35.attention.head_count arr[i32,45]      = [64, 96, 96, 96, 64, 96, 96, 96, 64, ...
[56347] 0.00.362.575 I llama_model_loader: - kv   9:                      step35.rope.freq_base f32              = 5000000.000000
[56347] 0.00.362.576 I llama_model_loader: - kv  10:                  step35.rope.freq_base_swa f32              = 10000.000000
[56347] 0.00.362.577 I llama_model_loader: - kv  11:                  step35.expert_gating_func u32              = 2
[56347] 0.00.362.577 I llama_model_loader: - kv  12:                step35.attention.key_length u32              = 128
[56347] 0.00.362.577 I llama_model_loader: - kv  13:              step35.attention.value_length u32              = 128
[56347] 0.00.362.581 I llama_model_loader: - kv  14:             step35.attention.head_count_kv arr[i32,45]      = [8, 8, 8, 8, 8, 8, 8, 8, 8, 8, 8, 8, ...
[56347] 0.00.362.581 I llama_model_loader: - kv  15:            step35.attention.sliding_window u32              = 512
[56347] 0.00.362.584 I llama_model_loader: - kv  16:    step35.attention.sliding_window_pattern arr[bool,45]     = [false, true, true, true, false, true...
[56347] 0.00.362.585 I llama_model_loader: - kv  17:                        step35.expert_count u32              = 288
[56347] 0.00.362.585 I llama_model_loader: - kv  18:                   step35.expert_used_count u32              = 8
[56347] 0.00.362.586 I llama_model_loader: - kv  19:          step35.expert_feed_forward_length u32              = 1280
[56347] 0.00.362.586 I llama_model_loader: - kv  20:   step35.expert_shared_feed_forward_length u32              = 1280
[56347] 0.00.362.587 I llama_model_loader: - kv  21:                step35.expert_weights_scale f32              = 3.000000
[56347] 0.00.362.587 I llama_model_loader: - kv  22:                 step35.expert_weights_norm bool             = true
[56347] 0.00.362.588 I llama_model_loader: - kv  23:           step35.leading_dense_block_count u32              = 3
[56347] 0.00.362.588 I llama_model_loader: - kv  24:                  step35.moe_every_n_layers u32              = 1
[56347] 0.00.362.589 I llama_model_loader: - kv  25:    step35.attention.layer_norm_rms_epsilon f32              = 0.000010
[56347] 0.00.362.596 I llama_model_loader: - kv  26:                    step35.swiglu_clamp_exp arr[f32,45]      = [0.000000, 0.000000, 0.000000, 0.0000...
[56347] 0.00.362.604 I llama_model_loader: - kv  27:                  step35.swiglu_clamp_shexp arr[f32,45]      = [0.000000, 0.000000, 0.000000, 0.0000...
[56347] 0.00.362.604 I llama_model_loader: - kv  28:                       tokenizer.ggml.model str              = gpt2
[56347] 0.00.362.604 I llama_model_loader: - kv  29:                         tokenizer.ggml.pre str              = deepseek-v3
[56347] 0.00.375.002 I llama_model_loader: - kv  30:                      tokenizer.ggml.tokens arr[str,128896]  = ["<|begin▁of▁sentence|>", "<�...
[56347] 0.00.377.837 I llama_model_loader: - kv  31:                  tokenizer.ggml.token_type arr[i32,128896]  = [3, 3, 3, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
[56347] 0.00.388.195 I llama_model_loader: - kv  32:                      tokenizer.ggml.merges arr[str,127741]  = ["Ġ t", "Ġ a", "i n", "Ġ Ġ", "h e...
[56347] 0.00.388.234 I llama_model_loader: - kv  33:                tokenizer.ggml.bos_token_id u32              = 0
[56347] 0.00.388.253 I llama_model_loader: - kv  34:                tokenizer.ggml.eos_token_id u32              = 128007
[56347] 0.00.388.269 I llama_model_loader: - kv  35:            tokenizer.ggml.padding_token_id u32              = 1
[56347] 0.00.388.284 I llama_model_loader: - kv  36:               tokenizer.ggml.add_bos_token bool             = true
[56347] 0.00.388.312 I llama_model_loader: - kv  37:               tokenizer.ggml.add_sep_token bool             = false
[56347] 0.00.388.338 I llama_model_loader: - kv  38:               tokenizer.ggml.add_eos_token bool             = false
[56347] 0.00.388.365 I llama_model_loader: - kv  39:                    tokenizer.chat_template str              = {% macro render_message_content(messa...
[56347] 0.00.388.366 I llama_model_loader: - kv  40:               general.quantization_version u32              = 2
[56347] 0.00.388.366 I llama_model_loader: - kv  41:                          general.file_type u32              = 112
[56347] 0.00.388.367 I llama_model_loader: - kv  42:                      quantize.imatrix.file str              = /srv/ssd/sn850x/models/stepfun-ai/Ste...
[56347] 0.00.388.368 I llama_model_loader: - kv  43:                   quantize.imatrix.dataset str              = /mnt/lvyichen/step3.6_final_model_bf1...
[56347] 0.00.388.369 I llama_model_loader: - kv  44:             quantize.imatrix.entries_count u32              = 528
[56347] 0.00.388.369 I llama_model_loader: - kv  45:              quantize.imatrix.chunks_count u32              = 4868
[56347] 0.00.388.370 I llama_model_loader: - kv  46:                                   split.no u16              = 0
[56347] 0.00.388.370 I llama_model_loader: - kv  47:                                split.count u16              = 9
[56347] 0.00.388.371 I llama_model_loader: - kv  48:                        split.tensors.count i32              = 754
[56347] 0.00.388.375 I llama_model_loader: - type  f32:  266 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q4_K:   90 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q5_K:  225 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q4_0_rocmfp4_fast:    2 tensors
[56347] 0.00.388.376 I llama_model_loader: - type q3_0_rocmfpx:  171 tensors
[56347] 0.00.388.381 I print_info: file format = GGUF V3 (latest)
[56347] 0.00.388.381 I print_info: file type   = Q3_0_ROCMFPX
[56347] 0.00.388.387 I print_info: file size   = 81.76 GiB (3.57 BPW)
[56347] 0.00.388.600 I llama_prepare_model_devices: using device Vulkan0 (Radeon 8060S Graphics (RADV GFX1151)) (0000:c5:00.0) - 127289 MiB free
[56347] 0.00.440.234 I load: 0 unused tokens
[56347] 0.00.450.882 I load: printing all EOG tokens:
[56347] 0.00.450.885 I load:   - 1 ('<|end▁of▁sentence|>')
[56347] 0.00.450.886 I load:   - 128007 ('<|im_end|>')
[56347] 0.00.451.103 I load: special tokens cache size = 818
[56347] 0.00.483.257 I load: token to piece cache size = 0.8220 MB
[56347] 0.00.483.297 I print_info: arch                  = step35
[56347] 0.00.483.298 I print_info: vocab_only            = 0
[56347] 0.00.483.298 I print_info: no_alloc              = 0
[56347] 0.00.483.298 I print_info: n_ctx_train           = 262144
[56347] 0.00.483.299 I print_info: n_embd                = 4096
[56347] 0.00.483.301 I print_info: n_embd_inp            = 4096
[56347] 0.00.483.301 I print_info: n_layer               = 45
[56347] 0.00.483.323 I print_info: n_head                = [64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64, 96, 96, 96, 64]
[56347] 0.00.483.326 I print_info: n_head_kv             = 8
[56347] 0.00.483.326 I print_info: n_rot                 = 64
[56347] 0.00.483.327 I print_info: n_swa                 = 512
[56347] 0.00.483.329 I print_info: is_swa_any            = 1
[56347] 0.00.483.329 I print_info: n_embd_head_k         = 128
[56347] 0.00.483.330 I print_info: n_embd_head_v         = 128
[56347] 0.00.483.334 I print_info: n_gqa                 = [8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8, 12, 12, 12, 8]
[56347] 0.00.483.340 I print_info: n_embd_k_gqa          = 1024
[56347] 0.00.483.344 I print_info: n_embd_v_gqa          = 1024
[56347] 0.00.483.345 I print_info: f_norm_eps            = 0.0e+00
[56347] 0.00.483.346 I print_info: f_norm_rms_eps        = 1.0e-05
[56347] 0.00.483.346 I print_info: f_clamp_kqv           = 0.0e+00
[56347] 0.00.483.347 I print_info: f_max_alibi_bias      = 0.0e+00
[56347] 0.00.483.347 I print_info: f_logit_scale         = 0.0e+00
[56347] 0.00.483.347 I print_info: f_attn_scale          = 0.0e+00
[56347] 0.00.483.348 I print_info: f_attn_value_scale    = 0.0000
[56347] 0.00.483.350 I print_info: n_ff                  = 11264
[56347] 0.00.483.351 I print_info: n_expert              = 288
[56347] 0.00.483.351 I print_info: n_expert_used         = 8
[56347] 0.00.483.351 I print_info: n_expert_groups       = 0
[56347] 0.00.483.351 I print_info: n_group_used          = 0
[56347] 0.00.483.351 I print_info: causal attn           = 1
[56347] 0.00.483.352 I print_info: pooling type          = -1
[56347] 0.00.483.352 I print_info: rope type             = 2
[56347] 0.00.483.352 I print_info: rope scaling          = linear
[56347] 0.00.483.354 I print_info: freq_base_train       = 5000000.0
[56347] 0.00.483.354 I print_info: freq_scale_train      = 1
[56347] 0.00.483.355 I print_info: freq_base_swa         = 10000.0
[56347] 0.00.483.355 I print_info: freq_scale_swa        = 1
[56347] 0.00.483.355 I print_info: n_embd_head_k_swa     = 128
[56347] 0.00.483.356 I print_info: n_embd_head_v_swa     = 128
[56347] 0.00.483.356 I print_info: n_rot_swa             = 128
[56347] 0.00.483.356 I print_info: n_ctx_orig_yarn       = 262144
[56347] 0.00.483.356 I print_info: rope_yarn_log_mul     = 0.0000
[56347] 0.00.483.357 I print_info: rope_finetuned        = unknown
[56347] 0.00.483.358 I print_info: model type            = 196B.A11B
[56347] 0.00.483.359 I print_info: model params          = 196.96 B
[56347] 0.00.483.359 I print_info: general.name          = Step-3.7
[56347] 0.00.483.364 I print_info: vocab type            = BPE
[56347] 0.00.483.367 I print_info: n_vocab               = 128896
[56347] 0.00.483.367 I print_info: n_merges              = 127741
[56347] 0.00.483.368 I print_info: BOS token             = 0 '<|begin▁of▁sentence|>'
[56347] 0.00.483.368 I print_info: EOS token             = 128007 '<|im_end|>'
[56347] 0.00.483.368 I print_info: EOT token             = 128007 '<|im_end|>'
[56347] 0.00.483.369 I print_info: PAD token             = 1 '<|end▁of▁sentence|>'
[56347] 0.00.483.369 I print_info: LF token              = 201 'Ċ'
[56347] 0.00.483.369 I print_info: FIM PRE token         = 128801 '<|fim▁begin|>'
[56347] 0.00.483.369 I print_info: FIM SUF token         = 128800 '<|fim▁hole|>'
[56347] 0.00.483.370 I print_info: FIM MID token         = 128802 '<|fim▁end|>'
[56347] 0.00.483.370 I print_info: EOG token             = 1 '<|end▁of▁sentence|>'
[56347] 0.00.483.371 I print_info: EOG token             = 128007 '<|im_end|>'
[56347] 0.00.483.371 I print_info: max token length      = 256
[56347] 0.00.483.374 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = true)
[56347] 0.04.960.316 I load_tensors: offloading output layer to GPU
[56347] 0.04.960.320 I load_tensors: offloading 44 repeating layers to GPU
[56347] 0.04.960.320 I load_tensors: offloaded 46/46 layers to GPU
[56347] 0.04.960.332 I load_tensors:      Vulkan0 model buffer size = 83458.60 MiB
[56347] 0.04.960.333 I load_tensors:  Vulkan_Host model buffer size =   267.48 MiB
[56347] ....................................................................................................
[56347] 0.35.012.618 I common_init_result: added <|end▁of▁sentence|> logit bias = -inf
[56347] 0.35.013.530 I common_init_result: added <|im_end|> logit bias = -inf
[56347] 0.35.013.682 I llama_context: constructing llama_context
[56347] 0.35.013.690 I llama_context: n_seq_max     = 1
[56347] 0.35.013.691 I llama_context: n_ctx         = 262144
[56347] 0.35.013.691 I llama_context: n_ctx_seq     = 262144
[56347] 0.35.013.692 I llama_context: n_batch       = 32768
[56347] 0.35.013.692 I llama_context: n_ubatch      = 2048
[56347] 0.35.013.693 I llama_context: causal_attn   = 1
[56347] 0.35.013.694 I llama_context: flash_attn    = enabled
[56347] 0.35.013.695 I llama_context: kv_unified    = false
[56347] 0.35.013.702 I llama_context: freq_base     = 5000000.0
[56347] 0.35.013.703 I llama_context: freq_scale    = 1
[56347] 0.35.013.704 I llama_context: n_rs_seq      = 0
[56347] 0.35.013.915 I llama_context: Vulkan_Host  output buffer size =     0.49 MiB
[56347] 0.35.014.793 I llama_kv_cache_iswa: creating non-SWA KV cache, size = 262144 cells
[56347] 0.35.527.653 I llama_kv_cache:    Vulkan0 KV buffer size =  6528.00 MiB
[56347] 0.36.074.391 I llama_kv_cache: size = 6528.00 MiB (262144 cells,  12 layers,  1/1 seqs), K (q8_0): 3264.00 MiB, V (q8_0): 3264.00 MiB
[56347] 0.36.074.403 I llama_kv_cache: attn_rot_k = 1, n_embd_head_k_all = 128
[56347] 0.36.074.404 I llama_kv_cache: attn_rot_v = 1, n_embd_head_k_all = 128
[56347] 0.36.074.424 I llama_kv_cache_iswa: creating     SWA KV cache, size = 2560 cells
[56347] 0.36.074.691 I llama_kv_cache:    Vulkan0 KV buffer size =   175.31 MiB
[56347] 0.36.089.912 I llama_kv_cache: size =  175.31 MiB (  2560 cells,  33 layers,  1/1 seqs), K (q8_0):   87.66 MiB, V (q8_0):   87.66 MiB
[56347] 0.36.090.553 I llama_kv_cache: attn_rot_k = 1, n_embd_head_k_all = 128
[56347] 0.36.090.573 I llama_kv_cache: attn_rot_v = 1, n_embd_head_k_all = 128
[56347] 0.36.090.626 I sched_reserve: reserving ...
[56347] 0.36.091.944 I sched_reserve: resolving fused Gated Delta Net support:
[56347] 0.36.094.863 I sched_reserve: fused Gated Delta Net (autoregressive) enabled
[56347] 0.36.096.387 I sched_reserve: fused Gated Delta Net (chunked) enabled
[56347] 0.37.038.147 I sched_reserve:    Vulkan0 compute buffer size =  3300.23 MiB
[56347] 0.37.038.158 I sched_reserve: Vulkan_Host compute buffer size =  2132.24 MiB
[56347] 0.37.038.158 I sched_reserve: graph nodes  = 3874
[56347] 0.37.038.159 I sched_reserve: graph splits = 2
[56347] 0.37.038.163 I sched_reserve: reserve took 947.51 ms, sched copies = 1
[56347] 0.37.038.224 I srv    load_model: creating MTP draft context against the target model '/mnt/models/jcbtc-Step-3.7-Flash-ROCmFPX-Q3-QualityPlus/Step-3.7-Flash-ROCmFPX-Q3-QualityPlus-00001-of-00009.gguf'
[56347] 0.37.038.232 W llama_init_from_model: context type MTP requested but model doesn't contain MTP layers
[56347] 0.37.038.233 E srv    load_model: failed to create MTP context
[56347] 0.37.038.235 I srv    operator(): operator(): cleaning up before exit...
[56347] 0.37.044.237 E srv          main: exiting due to model loading error
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment