qwen3_5_model_descriptor#

Classes

class Qwen3P5KVHeadsPruningMixIn#

Bases: KVHeadsPruningMixIn

KV-head pruning for Qwen3.5 gated full-attention layers.

__init__(layer_descriptor)#
Parameters:

layer_descriptor (KVHeadsLayerDescriptor)

prune_single_layer(layer_idx, parent_state_dict, new_state_dict, original_config, new_config, descriptor, gqa_init_mode, mlp_init_config, is_original_mha, keys, keys_to_remove, **kwargs)#
Parameters:
  • layer_idx (int)

  • parent_state_dict (dict)

  • new_state_dict (dict)

  • original_config (PreTrainedConfig)

  • new_config (PreTrainedConfig)

  • gqa_init_mode (GQAInitMode)

  • mlp_init_config (dict[str, Any] | None)

  • is_original_mha (bool)

  • keys (dict)

  • keys_to_remove (dict)

class Qwen3P5MoeTextModelDescriptor#

Bases: _Qwen3P5MoeModelDescriptor

classmethod anymodel_arch_info()#
Return type:

dict[str, Any]

static init_rotary_embedding(model, runtime)#
class Qwen3P5MoeVLModelDescriptor#

Bases: _Qwen3P5MoeModelDescriptor

static init_rotary_embedding(model, runtime)#
classmethod runtime_benchmark_export_descriptor()#
Return type:

Type[ModelDescriptor]

class Qwen3P5TextFFNIntermediateLayerDescriptor#

Bases: FFNIntermediateLayerDescriptor

__init__(down_proj_name='mlp.down_proj', ffn_prefix_name='model.layers.{layer_idx}.mlp', linear_weight_names=<factory>)#
Parameters:
  • down_proj_name (str)

  • ffn_prefix_name (str)

  • linear_weight_names (List[str])

Return type:

None

down_proj_name: str = 'mlp.down_proj'#
ffn_prefix_name: str = 'model.layers.{layer_idx}.mlp'#
linear_weight_names: List[str]#
class Qwen3P5TextGatedDeltaNetLayerDescriptor#

Bases: GatedDeltaNetLayerDescriptor

__init__(target_name='linear_attn', gdn_prefix_name='model.layers.{layer_idx}.linear_attn')#
Parameters:
  • target_name (str)

  • gdn_prefix_name (str)

Return type:

None

gdn_prefix_name: str = 'model.layers.{layer_idx}.linear_attn'#
target_name: str = 'linear_attn'#
class Qwen3P5TextKVHeadsLayerDescriptor#

Bases: KVHeadsLayerDescriptor

__init__(o_proj_name='self_attn.o_proj', attn_prefix_name='model.layers.{layer_idx}.self_attn', qkvo_weight_names=<factory>)#
Parameters:
  • o_proj_name (str)

  • attn_prefix_name (str)

  • qkvo_weight_names (List[str])

Return type:

None

attn_prefix_name: str = 'model.layers.{layer_idx}.self_attn'#
o_proj_name: str = 'self_attn.o_proj'#
qkvo_weight_names: List[str]#
class Qwen3P5TextModelDescriptor#

Bases: _Qwen3P5BaseModelDescriptor

classmethod create_runtime_benchmark_model(runtime_config, block_configs)#
Parameters:

block_configs (list[BlockConfig])

classmethod embedding_pruning_spec(config, *, widths, alignment)#
Parameters:

alignment (int)

static final_norm_name()#
static init_rotary_embedding(model, runtime)#
static input_embedding_name()#
static layer_block_name(index)#
Parameters:

index (int)

static layer_name_predicates(num_layers)#
Parameters:

num_layers (int)

Return type:

Dict[str, Pattern]

static output_embedding_name()#
static pruning_mixins()#
Return type:

Dict[str, PruningMixIn]

classmethod runtime_benchmark_config_fields(lm_config)#
Return type:

dict[str, Any]

classmethod runtime_vllm_benchmark_args(config)#
Parameters:

config (Any)

Return type:

list[str]

class Qwen3P5VLFFNIntermediateLayerDescriptor#

Bases: FFNIntermediateLayerDescriptor

__init__(down_proj_name='mlp.down_proj', ffn_prefix_name='model.language_model.layers.{layer_idx}.mlp', linear_weight_names=<factory>)#
Parameters:
  • down_proj_name (str)

  • ffn_prefix_name (str)

  • linear_weight_names (List[str])

Return type:

None

down_proj_name: str = 'mlp.down_proj'#
ffn_prefix_name: str = 'model.language_model.layers.{layer_idx}.mlp'#
linear_weight_names: List[str]#
class Qwen3P5VLGatedDeltaNetLayerDescriptor#

Bases: GatedDeltaNetLayerDescriptor

__init__(target_name='linear_attn', gdn_prefix_name='model.language_model.layers.{layer_idx}.linear_attn')#
Parameters:
  • target_name (str)

  • gdn_prefix_name (str)

Return type:

None

gdn_prefix_name: str = 'model.language_model.layers.{layer_idx}.linear_attn'#
target_name: str = 'linear_attn'#
class Qwen3P5VLKVHeadsLayerDescriptor#

Bases: KVHeadsLayerDescriptor

__init__(o_proj_name='self_attn.o_proj', attn_prefix_name='model.language_model.layers.{layer_idx}.self_attn', qkvo_weight_names=<factory>)#
Parameters:
  • o_proj_name (str)

  • attn_prefix_name (str)

  • qkvo_weight_names (List[str])

Return type:

None

attn_prefix_name: str = 'model.language_model.layers.{layer_idx}.self_attn'#
o_proj_name: str = 'self_attn.o_proj'#
qkvo_weight_names: List[str]#
class Qwen3P5VLModelDescriptor#

Bases: _Qwen3P5BaseModelDescriptor

classmethod anymodel_arch_info()#
Return type:

dict[str, Any]

classmethod embedding_pruning_spec(config, *, widths, alignment)#
Parameters:

alignment (int)

static final_norm_name()#
static get_language_model_config(config)#
static init_rotary_embedding(model, runtime)#
static input_embedding_name()#
static layer_block_name(index)#
Parameters:

index (int)

static layer_name_predicates(num_layers)#
Parameters:

num_layers (int)

Return type:

Dict[str, Pattern]

static output_embedding_name()#
static pruning_mixins()#
Return type:

Dict[str, PruningMixIn]

classmethod runtime_benchmark_export_descriptor()#
Return type:

Type[ModelDescriptor]

classmethod vision_module_names()#
Return type:

tuple[str, …]