Business Process Diagrams

导言

业务讨论中最常见的误区,不是图画得不够漂亮,而是用一张图回答了错误的问题。想确认执行步骤,却画满参与者和消息;想追踪订单状态,却用时序图枚举所有异常;想划分责任,却把普通泳道当作 BPMN 执行语义。

本文用同一个“电商订单履约”案例做受控比较:业务事实不变,只改变观察轴。流程图看步骤,BPMN 看参与者、事件和规则,泳道图看责任与系统,状态机看订单生命周期,时序图看系统调用。读完后,应该先能选择合适的图,再决定用什么工具绘制。

Read more

Computing Systems Optimization

导言

我的长期职业目标可以收束为一句话:理解软件计算逻辑,把它映射到计算、通信、存储和容量受限的硬件上,通过拆分、掩盖、流水和协同设计提高有效利用率;再把这套理解变成可扩展的性能模型、硬件建议与团队分工。

这不是“会调几个 Kernel”或“熟悉某个训练框架”的目标。我要培养的是从工作负载、系统、软件到硬件的完整判断力:知道数据从哪里来、何时产生、在哪里停留、被谁消费、为什么等待,以及增加哪一种资源才真正缩短端到端关键路径。

Read more

Evidence-Driven Goal Loop

导言

我曾把一个看起来很明确的任务交给 AI:阅读 verl 代码,参考已有 GRPO 脚本适配 Kimi3 的减层训练,并在 NPU 上跑通第一个强化学习优化步。两天后,AI 仍在换软件版本、调整层数和重跑 OOM。真正棘手的不是“还没成功”,而是我无法回答领导接下来一定会问的问题:卡在哪里、解决过什么、时间花在哪里、还能不能解决、还要多久、代码是否上仓、中文设计文档在哪里?

这促使我把 Goal 从一句终点描述改造成一个工程控制面:用 goal-definition 先与用户签订任务合同,再让每个 Goal 强制携带 goal-execution,按证据等级执行有界循环。最终目标仍然重要,但每一轮都必须留下新的事实、排除一个原因,或形成一个可交付成果。

Read more

AI Optimization Stack

导言

“模型优化”“框架优化”“算子优化”和“软硬协同”经常出现在同一段讨论里,却不一定在回答同一个问题。本文建立一张七层诊断地图:先确认被控制的对象、真正变化的物理量和最后采用的验收指标,再判断优化属于哪一层。这个分层不是唯一的行业标准,而是一套避免跨层归因错误的工作方法。

Read more

AI Technology Value Stack

导言

最近我对应该长期研究什么技术产生了迷茫。我不喜欢人员管理:每个人的诉求和心思不同,统一理解、共情和换位思考会持续消耗精力。我更希望别人因为我的技术判断、工程能力和解决方案付费。

但“越底层越关键”“越难越值钱”“卖价越高工资越高”都不是可靠规律。AI 应用背后横跨算法、训练系统、推理服务、框架、操作系统、驱动、芯片、封装和晶圆制造;每一层的交易单位、商业模式、资本强度和劳动议价方式完全不同。本文用截至 2026 年 7 月 29 日可公开核验的价格、收入和工资数据,回答两个问题:钱在技术栈中如何流动,以及我应该站在哪个位置积累长期能力。

Read more

AI Startup Career Risk

导言

科技初创公司的 offer 往往把现金、成长和期权包装成一个总数,但三者面对的是完全不同的风险。本文先澄清国内初创公司融资、退出与失败数据的统计边界,再梳理智谱、MiniMax、月之暗面、阶跃星辰和上海人工智能实验室的融资、模型与上市事件,并以科大讯飞星火 X1、智谱、MiniMax、商汤和第四范式的公开披露区分研发工资与算力单位成本,最后拆解一份 月薪 68,000 元、两年 160 万元期权、模型 Infra 优化、11-10-6 的阶跃星辰 offer。结论不把媒体估值、内部价格或上市计划冒充现金,而是给出可复查的事实、主观情景区间和签约前问题清单。

Read more

Multi-Objective Decision Making

导言

找工作时,工资、通勤、城市成本、稳定性、技术成长和市场热度都很重要。最让人困扰的却不是指标多,而是不知道各项应该多重要,也不知道许多事实究竟是什么。给每项随手打一个 1–10 分,会制造精确感;把所有问题都调研到底,又可能永远无法做决定。

更合适的做法不是在“粗糙打分”和“无限调研”之间二选一,而是建立一套分层流程:先用底线淘汰不可接受项,再用区间和情景保留未知,用敏感性分析定位会改变选择的变量,只深入调查这些变量,并在新增信息不再值得其成本时停止。

Read more

Kimi K3 Report

导言

Kimi K3 是一个面向长时程智能体任务的原生多模态混合专家模型:总参数量 2.78T,每个词元激活 104.2B 参数,训练上下文最长 100 万词元。它把 Kimi Delta Attention(KDA)、Block Attention Residuals(AttnRes)和 Stable LatentMoE 放进同一套训练系统,并进一步连接原生多模态预训练、分档推理投入强化学习、量化感知后训练与大规模并行基础设施。

本文按照论文的段落和小段落顺序进行逐句翻译,保留全部 16 幅图、5 张表、编号公式、交叉引用和技术附录。为帮助第一次接触相关概念的读者,额外说明均放在明确标记的“小白提示”中,不与原论文观点混写。

Read more

Inference Quantization Formats

导言

W8A8W8A4W16A8 看似只差两个数字,实际可能对应完全不同的对象、尺度粒度、在线流程和硬件 kernel;FP8MXFP8 都是八位元素,却又因块尺度而具有不同的数据布局。更容易误解的是,量化位宽、检查点大小和最低运行显存是三个不同问题

本文先建立一套可复用的阅读方法,再用物理结构、实现逻辑、流程、时序和张量数据流解释常见路径,最后核对截至 2026-07-28 的 Qwen3.5、Kimi K3 和 GLM-5.2 开放权重。所有“多大”均来自当前 Hugging Face 仓库中 .safetensors 文件的实际字节和,而不是用参数量乘标称位宽反推。

Read more

UB-Mesh Architecture

导言

训练万亿参数模型时,几千甚至上万张 NPU/GPU 不是各算各的。每一步训练都会反复交换梯度、激活和专家 token,网络就像一座每秒要分拣海量包裹的城市:包裹搬得慢,昂贵的计算卡只能停下来等路。

UB-Mesh 的关键想法不是发明一条“无限快”的网线,而是承认通信具有局部性:把最频繁、最大量的通信放到近处的短链路,把较少的远程通信留给远层网络,再让路由、集合通信和容错都理解这张不对称的地图。

Read more