Views
No views yet
1slices:
2 - sources:
3 - model: TheHierophant/Underground-Cognitive-V0.3-test
4 layer_range: [0, 8]
5 parameters:
6 attention:
7 - filter: q_proj
8 value: 1.15
9 - filter: k_proj
10 value: 1.1
11 - filter: v_proj
12 value: 1.2
13 - filter: down_proj
14 value: 1.1
15 significance: 0.85 # Añadir relevancia para reforzar cálculos precisos en las primeras capas
16 weight: 0.3 # Peso para garantizar que las capas iniciales manejen la información con precisión
17 rope_scaling:
18 type: "linear"
19 value: 0.7 # Ajuste para mejorar la capacidad posicional
20 - sources:
21 - model: TheHierophant/Underground-Cognitive-V0.3-test
22 layer_range: [8, 16]
23 parameters:
24 attention:
25 - filter: q_proj
26 value: 1.25
27 - filter: k_proj
28 value: 1.15
29 - filter: v_proj
30 value: 1.3
31 - filter: down_proj
32 value: 1.2
33 weight: 0.35
34 significance: 0.9 # Aumentar el enfoque en la lógica matemática básica para diferenciar iteración y recursión
35 rope_scaling:
36 type: "linear"
37 value: 0.85 # Factor dinámico para asegurar flexibilidad y ajuste automático en cálculos
38 - sources:
39 - model: TheHierophant/Underground-Cognitive-V0.3-test
40 layer_range: [16, 32]
41 parameters:
42 attention:
43 - filter: o_proj
44 value: 1.5
45 - filter: q_proj
46 value: 1.4
47 - filter: v_proj
48 value: 1.35
49 - filter: down_proj
50 value: 1.3
51 weight: 0.4 # Más peso a capas medias para reforzar razonamiento intermedio
52 significance: 0.85 # Focalización para la transferencia de atención a capas superiores
53 - sources:
54 - model: TheHierophant/Underground-Cognitive-V0.3-test
55 layer_range: [32, 48]
56 parameters:
57 attention:
58 - filter: o_proj
59 value: 2.0
60 - filter: q_proj
61 value: 1.8
62 - filter: v_proj
63 value: 1.7
64 - filter: down_proj
65 value: 1.65
66 weight: 0.5 # Incremento de peso para fortalecer las capas profundas y el análisis complejo
67 significance: 0.95 # Enfoque en mejorar la lógica no lineal y reforzar la atención en problemas complejos
68base_model_config:
69 attention_bias: false
70 attention_dropout: 0.05 # Añadir dropout para prevenir sobreajuste en cálculos repetitivos
71 hidden_act: "silu" # Mantener la función silu para una activación suave y continua
72 hidden_size: 4096
73 initializer_range: 0.02
74 intermediate_size: 14336
75 max_position_embeddings: 4096
76 num_attention_heads: 32
77 num_hidden_layers: 48
78 num_key_value_heads: 8
79 pretraining_tp: 1
80 rms_norm_eps: 1e-05
81 rope_scaling:
82 type: "linear" # Ajuste basado en el tipo linear para optimizar la capacidad adaptativa
83 value: 1.1 # Factor ajustado para mantener un escalamiento eficiente
84 rope_theta: 12000.0 # Ajustado para mejorar la capacidad posicional en tareas matemáticas
85 tie_word_embeddings: false
86 vocab_size: 32000
87 use_cache: true # Habilitar cache para mejorar eficiencia durante la inferencia
88 dtype: bfloat16
89merge_method: passthrough