IP属地:吉林
📌 今天总结最近解析的 Kimi-K3 后训练算法、模型架构、Infra 相关技术重点。
📌 本期解析:On-Policy Distillation 算法中 Sampled-token OPD / Full-vocabulary OP...
📌 本期对比总结Kimi K3/ GLM 5/ DeepSeek V4 后训练On-Policy Distillation 算法。
📌 本期结合 Kimi K3 技术报告/架构源码拆解架构设计,详解 K3 架构如何支持 1M 上下文拓展、2.8T参数扩容。
📌 本期解析 Kimi K3 技术报告|多模态预训练+On-Policy Distillation后训练全流程。
📌 本期解析秋招提前批面试题:On-Policy Distillation 算法中正向KL / 反向KL区别?sampled-token OPD...
📌 为什么 MiMo-V2-Flash(MOPD)和 GLM-5 通过替换 GRPO 训练框架中的优势项可以实现 OPD。
📌 今天解析秋招提前批面试题:为什么PPO优化算法中clip之后仍然需要min操作?
📌 今天汇总一下 DeepSeek-V4 后训练算法、模型架构、Infra 相关技术。