3 16 hours ago

Predictive Autonomous Learning And N̵u̵c̵l̵e̵a̵r Command Evaluation Model

11360c148666 · 1.1MB
    Metadata
  • general.architecture
    qwen2moe
  • general.file_type
    Q4_K_M
  • qwen2moe.attention.head_count
    9
  • qwen2moe.attention.head_count_kv
    3
  • qwen2moe.attention.layer_norm_rms_epsilon
    1e-06
  • qwen2moe.block_count
    1
  • qwen2moe.context_length
    16
  • qwen2moe.embedding_length
    36
  • qwen2moe.expert_count
    9
  • qwen2moe.expert_feed_forward_length
    18
  • qwen2moe.expert_shared_feed_forward_length
    5632
  • qwen2moe.expert_used_count
    2
  • qwen2moe.feed_forward_length
    72
  • qwen2moe.rope.freq_base
    10000
  • tokenizer.ggml.bos_token_id
    1
  • tokenizer.ggml.eos_token_id
    2
  • tokenizer.ggml.merges
    [Ā Ā]
  • tokenizer.ggml.model
    gpt2
  • tokenizer.ggml.padding_token_id
    0
  • tokenizer.ggml.pre
    gpt-2
  • tokenizer.ggml.token_type
    [3, 3, 3, 3, 1, ...]
  • tokenizer.ggml.tokens
    [<pad>, <bos>, <eos>, <unk>, !, ...]
  • tokenizer.ggml.unknown_token_id
    3
  • Tensor
  • token_embd.weight
    F16
    [36, 261]
  • blk.0
  • blk.0.attn_k.bias
    F32
    [12]
  • blk.0.attn_k.weight
    F16
    [36, 12]
  • blk.0.attn_norm.weight
    F32
    [36]
  • blk.0.attn_output.weight
    F16
    [36, 36]
  • blk.0.attn_q.bias
    F32
    [36]
  • blk.0.attn_q.weight
    F16
    [36, 36]
  • blk.0.attn_v.bias
    F32
    [12]
  • blk.0.attn_v.weight
    F16
    [36, 12]
  • blk.0.ffn_down_exps.weight
    F16
    [18, 36, 9]
  • blk.0.ffn_down_shexp.weight
    Q6_K
    [5632, 36]
  • blk.0.ffn_gate_exps.weight
    F16
    [36, 18, 9]
  • blk.0.ffn_gate_inp.weight
    F32
    [36, 9]
  • blk.0.ffn_gate_inp_shexp.weight
    F32
    [36]
  • blk.0.ffn_gate_shexp.weight
    F16
    [36, 5632]
  • blk.0.ffn_norm.weight
    F32
    [36]
  • blk.0.ffn_up_exps.weight
    F16
    [36, 18, 9]
  • blk.0.ffn_up_shexp.weight
    F16
    [36, 5632]
  • output.weight
    F16
    [36, 261]
  • output_norm.weight
    F32
    [36]