BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks
BigBang 是一个通用 35B-A3B 模型,通过对抗式、自演化的生成器—评判器框架合成可验证前沿任务并进行后训练。该管线利用留出的真实研究任务进行校准,迭代提升任务难度与评估质量,从而在科学研究、推理、编程和工具调用上取得广泛增益。
研究分类
可复用训练配方、监督微调、数据选择、蒸馏和优化实践。
2 篇论文
BigBang 是一个通用 35B-A3B 模型,通过对抗式、自演化的生成器—评判器框架合成可验证前沿任务并进行后训练。该管线利用留出的真实研究任务进行校准,迭代提升任务难度与评估质量,从而在科学研究、推理、编程和工具调用上取得广泛增益。
DataPrep-Bench 是首个统一、以下游效果为依据的基准,用于评估大语言模型、智能体和数据工作流构建监督训练数据及预测候选数据集下游效用的能力。论文还提出技能驱动的数据构建智能体和分布对齐分数,后者在多数测试领域优于已有的质量、多样性与启发式评估方法。
2 篇论文
该论文指出 SwiGLU 在大正输入下接近二次放大会扩大输出范围并加剧 outlier,从而在低精度大规模 LLM 预训练中带来数值不稳定。论文提出 Power Linear Unit (PowLU),用有理幂函数在保持自适应非线性的同时稳定 spike 区域,并通过 scaling law 与 Ling 模型实验展示竞争性效果和更好的训练可扩展性。
该论文表明,预热后保持学习率恒定的 Warmup-Stable-Only 预训练策略,在 1B 和 8B 模型上均能稳定优于衰减式调度器的下游 SFT 表现。损失景观分析将这一增益归因于更平坦的极小值,它们能够保留模型的下游适应能力。
5 篇论文
该论文揭示了在策略蒸馏中的低 KL 一致性陷阱:教师模型会局部顺应学生模型已损坏的 rollout,因而几乎无法提供纠错监督。论文提出自适应在线终止规则 KAT,过滤这些无信息后缀,在提升数学推理准确率的同时将平均 rollout 长度减少 59.73%。
该论文提出 BRTS,采样多条教师轨迹,并按照正确性优先、与学生当前行为对齐程度次之的规则选择监督信号。其辅助教师上下文分支和基于真实答案的恢复机制提升了 OPD 在高难度数学推理基准上的表现。
该论文提出 TrOPD,通过仅在可靠区域使用反向 KL 监督,缓解教师与学生分布差异较大时在策略蒸馏的不稳定问题。该方法以裁剪、掩码或前向 KL 估计处理异常区域,并利用教师前缀的离策略指导将探索引回可信区域。
该论文指出 sampled-token OPD 的三类失效模式:token 级监督失衡、教师在学生生成前缀上的指导不可靠,以及 tokenizer 或特殊 token 不匹配。论文结合教师 top-K 局部支持匹配、top-p rollout 采样和特殊 token 掩码,提高训练稳定性并比标准 OPD 提升 19.8%。
该论文研究面向生成式大语言模型的白盒知识蒸馏,并提出 MiniLLM,用反向 KLD 替代标准前向 KLD,以避免学生模型高估教师分布中的低概率区域。论文推导了有效优化方法,并在 120M 到 13B 参数的不同模型族上提升指令跟随质量、校准性、曝光偏差和长文本生成表现。