📌 今天总结最近解析的 Kimi-K3 后训练算法、模型架构、Infra 相关技术重点。
📌 今天总结最近解析的 Kimi-K3 后训练算法、模型架构、Infra 相关技术重点。
📌 本期解析:On-Policy Distillation 算法中 Sampled-token OPD / Full-vocabulary OPD的区别?
📌 本期对比总结Kimi K3/ GLM 5/ DeepSeek V4 后训练On-Policy Distillation 算法。
📌 本期结合 Kimi K3 技术报告/架构源码拆解架构设计,详解 K3 架构如何支持 1M 上下文拓展、2.8T参数扩容。
📌 本期解析 Kimi K3 技术报告|多模态预训练+On-Policy Distillation后训练全流程。
📌 本期解析秋招提前批面试题:On-Policy Distillation 算法中正向KL / 反向KL区别?sampled-token OPD / Full-vocabul...
📌 为什么 MiMo-V2-Flash(MOPD)和 GLM-5 通过替换 GRPO 训练框架中的优势项可以实现 OPD。
📌 今天解析秋招提前批面试题:为什么PPO优化算法中clip之后仍然需要min操作?
📌 今天汇总一下 DeepSeek-V4 后训练算法、模型架构、Infra 相关技术。
📌 今天汇总一下 GLM-5.2 后训练算法、模型架构、Infra 相关技术。
📌 我们在项目实践:多模态 RL Agent(DAPO算法 & VeRL框架 & Think with images) 里用 DAPO 做的在线 RL:每一步先 rollou...
📌 本期解析最近一周智谱&清华的两篇涉及GLM5.2后训练的论文 SAO、CompactionRL。 ↩️ 相比我们之前的理论分析帖子《GLM-5.2 Agentic RL ...
📌 今天主题:回顾Qwen/Mimo/GLM/DeepSeek各家基座模型中的 On-Policy Distillation(OPD)技术。
📌 本期带来2026年上半年的 Agentic RL 开源项目推荐(简历项目可以基于此实现)筛选了几个方向: 🌟 奖励建模改进(Reward Modeling) 🌟 上下文压...
📌 本期解析最近 DeepSeek 的 Infra 推测解码工作 DSpark,直接用用 DeepSeek 家目前的基座模型 DeepSeek-V4-Pro-DSpark。
📌 今天继续讲 Agent Harness 系列,关注 Agent 测评/验证,通过 SweBench、Terminal-Bench、Tau-Bench 拆解工业界 Agen...
📌 GLM-5.2 的主分支注意力改用 DeepSeek 风格的 interleaved RoPE,indexer 仍然用非交错的 half-split RoPE(GLM-5...
📌 今天拆解 GLM-5.2 在长程 Agentic 任务下替换 group-wise GRPO 为 critic-based PPO 的逻辑,结合我们前段时间解析过的🔥 A...
📌 本期解析 GLM-5.2架构细节/源代码: 🌟 Interleaved RoPE 🌟 IndexCache 🌟 IndexShare 🌟 MTP Index Share ...
📌 Agent Harness 作为 2026 年上半年 Agent 技术代名词,在讲到具体方法论的时候却又“说不清”。 🔥 这个系列会通过解析 Claude Code / ...