Training Performance Model

导言

模型训练建模不是先问“MFU 有多高”,而是先把模型结构、硬件账本、并行切分、调度路径和实测校准放到同一个估算器里。MFU 是其中最干净的计算口径:它把模型理论必需 FLOPs、设备峰值和实测步时连在一起;但显存能不能放下、通信会不会卡住、padding 是否浪费、EP/TP/SP 是否合适,必须另算。

Read more

Scaling Law

导言

Scaling Law 不只是“模型越大越好”的经验总结,而是一套算力预算分配语言:在固定训练预算下,参数量、训练数据、序列长度和训练时长互相竞争;在固定推理预算下,模型大小、生成 token、采样策略、工具调用和 agent rollout 也互相竞争。本文只记录论文中可追溯的公开披露;没有披露的数据明确标为“未披露”,不从参数规模反推训练成本。

Read more

Personal Advantage Workflow

导言

多局点、多任务、多角色同时推进时,真正稀缺的不是勤奋,而是 判断力、取舍能力和可复用记录。均匀响应所有任务只能保证不出明显纰漏,却很难形成个人优势;优势通常来自少数高风险、高杠杆、高不确定、强依赖的局点。

本文把工作链路整理成一个可执行系统:先识别重点风险局点,再拒绝低优先级任务;先快穿刺关键假设,再并行派活和紧跟踪;先用原理、显存、性能 MFU 和投产约束做建模,再用实践验证、详细记录和持续修正形成历史;最后把优势进展、后续风险和必要求助稳定汇报出去。

Read more

AI Documentation Workflow

导言

这篇文章记录我当前的 Work with AI 文档工作流:不是把一段 prompt 扔给模型、得到一篇孤立文章,而是把调研、来源管理、论文图表、正文插图、图片上传、Hugo 写作规范、可复用 skill 和 git 发布串成一个可验证的流水线。

这条流水线的关键变化来自 Karpathy 的 LLM Wiki 思路:把知识库视作一个由 LLM 维护的 Markdown 代码库。原始资料进入 raw 层,结构化理解进入 wiki 层,Hugo 文章只是最终发布层。这样每次写作都会沉淀可复用记忆,而不是从聊天记录里重新发明一次。

Read more

Building Large-Scale AI Systems on Ascend: Training, Inference, and Multimodal Optimization

导言

谭邵杰,中国科学技术大学本硕毕业,现任华为昇腾训练开发工程师,专注于 Ascend NPU 上的大模型训练推理框架优化、多模态模型迁移、分布式并行训练、RL 优化与量化推理加速。

AI 训练推理框架与异构加速优化工程师,长期聚焦 Ascend NPU 生态下的大模型训练、推理、多模态迁移、分布式并行、RL 训练与量化优化。

Read more

AI Technology Value Stack

导言

最近我对应该长期研究什么技术产生了迷茫。我不喜欢人员管理:每个人的诉求和心思不同,统一理解、共情和换位思考会持续消耗精力。我更希望别人因为我的技术判断、工程能力和解决方案付费。

但“越底层越关键”“越难越值钱”“卖价越高工资越高”都不是可靠规律。AI 应用背后横跨算法、训练系统、推理服务、框架、操作系统、驱动、芯片、封装和晶圆制造;每一层的交易单位、商业模式、资本强度和劳动议价方式完全不同。本文用截至 2026 年 7 月 29 日可公开核验的价格、收入和工资数据,回答两个问题:钱在技术栈中如何流动,以及我应该站在哪个位置积累长期能力。

Read more

AI Startup Career Risk

导言

科技初创公司的 offer 往往把现金、成长和期权包装成一个总数,但三者面对的是完全不同的风险。本文先澄清国内初创公司融资、退出与失败数据的统计边界,再梳理智谱、MiniMax、月之暗面、阶跃星辰和上海人工智能实验室的融资、模型与上市事件,最后拆解一份 月薪 68,000 元、两年 160 万元期权、模型 Infra 优化、11-10-6 的阶跃星辰 offer。结论不把媒体估值、内部价格或上市计划冒充现金,而是给出可复查的事实、主观情景区间和签约前问题清单。

Read more

Multi-Objective Decision Making

导言

找工作时,工资、通勤、城市成本、稳定性、技术成长和市场热度都很重要。最让人困扰的却不是指标多,而是不知道各项应该多重要,也不知道许多事实究竟是什么。给每项随手打一个 1–10 分,会制造精确感;把所有问题都调研到底,又可能永远无法做决定。

更合适的做法不是在“粗糙打分”和“无限调研”之间二选一,而是建立一套分层流程:先用底线淘汰不可接受项,再用区间和情景保留未知,用敏感性分析定位会改变选择的变量,只深入调查这些变量,并在新增信息不再值得其成本时停止。

Read more

Kimi K3 Report

导言

Kimi K3 是一个面向长时程智能体任务的原生多模态混合专家模型:总参数量 2.78T,每个词元激活 104.2B 参数,训练上下文最长 100 万词元。它把 Kimi Delta Attention(KDA)、Block Attention Residuals(AttnRes)和 Stable LatentMoE 放进同一套训练系统,并进一步连接原生多模态预训练、分档推理投入强化学习、量化感知后训练与大规模并行基础设施。

本文按照论文的段落和小段落顺序进行逐句翻译,保留全部 16 幅图、5 张表、编号公式、交叉引用和技术附录。为帮助第一次接触相关概念的读者,额外说明均放在明确标记的“小白提示”中,不与原论文观点混写。

Read more

Inference Quantization Formats

导言

W8A8W8A4W16A8 看似只差两个数字,实际可能对应完全不同的对象、尺度粒度、在线流程和硬件 kernel;FP8MXFP8 都是八位元素,却又因块尺度而具有不同的数据布局。更容易误解的是,量化位宽、检查点大小和最低运行显存是三个不同问题

本文先建立一套可复用的阅读方法,再用物理结构、实现逻辑、流程、时序和张量数据流解释常见路径,最后核对截至 2026-07-28 的 Qwen3.5、Kimi K3 和 GLM-5.2 开放权重。所有“多大”均来自当前 Hugging Face 仓库中 .safetensors 文件的实际字节和,而不是用参数量乘标称位宽反推。

Read more