一个简单的尝试性demo,环境和官方环境一样
跑了9轮(还是慢啊),gsm上目前是28左右的效果
对比一下其他:
Device 2: Cor=188, CoT=85, Total=440
Accuracy on validation set: 554 / 1320 = 0.4196969696969697
CoT match on validation set: 238 / 1320 = 0.1803030303030303
coconut_9:
Accuracy on validation set: 398 / 1320 = 0.3015151515151515
CoT match on validation set: 0 / 1320 = 0.0
cot_7:
Device 2: Cor=190, CoT=82, Total=440
Accuracy on validation set: 551 / 1320 = 0.4174242424242424
CoT match on validation set: 211 / 1320 = 0.15984848484848485
coconut_7:
Accuracy on validation set: 307 / 1320 = 0.23257575757575757
CoT match on validation set: 0 / 1320 = 0.0
问题 → <|think|> → 隐空间推理 → <|key-insight|> 关键点1 → <|think-continue|> → 隐空间推理 → <|key-insight|> 关键点2 → ... → <|conclusion|> 最终答案
hybrid_coconut.py: 混合模型实现training_data_generator.py: 训练数据生成器demo_train.py: 训练脚本demo_inference.py: 推理演示config/hybrid_config.yaml: 配置文件