ONE ROUTE / 按先备与验收推进
345 核心小时,
78 个完整学习单元。
先完成35个基础单元与M1、完整G0,再沿系统、性能、厂商与编译器路线推进。小节保持完整,单元可以分多次学习;通过验收后再进入下一单元。
当前每周可持续容量尚未设定,本站不预设完成期限。阅读、书签、运行教学示例与填写用时不会自动通过M1、G0或项目验收。
基础预算与新增补授分开算
以上合计 345 核心小时。新增补授另列 420 分钟(7h),全部选择时共 352h;包含可选小节,不能悄悄塞回原估时。预算未经真人试学校准,实际学习有疑问时保存反馈并修订。
逐项查看新增补授的时间与落点
- vector首尾访问 · 15min · 单元 U14
- 派生对象拥有者认读 · 10min · 可选 · 单元 U25
- 短整数与span输入合同 · 15min · 单元 U29
- 异常占位代码读法 · 10min · 单元 U31
- 有限浮点与独立oracle · 30min · 单元 U33
- 系统宽整数类型 · 10min · 单元 SYS-00
- 线程启动、joinable与emplace捕获 · 30min · 单元 W05-3
- unique_lock状态 · 20min · 单元 W06-1
- notify_one与notify_all · 15min · 单元 W06-1
- yield的合同 · 10min · 单元 W06-2
- iota输入生成 · 15min · 单元 W07-2
- 固定种子、引擎与分布 · 20min · 单元 W05-5
- 测量时长读法 · 5min · 单元 W07-2
- partial_sum前缀累计 · 15min · 单元 W08-1
- 数值oracle回访 · 5min · 单元 W08-1
- leading dimension读法 · 15min · 单元 W08-3
- HIP launch与dim3 · 25min · 单元 W09-1
- TTNN四次调用 · 25min · 单元 W09-5
- Metalium三个host对象 · 20min · 单元 W10-2
- CSL局部语法 · 20min · 单元 W10-3
- SdkRuntime与完成 · 25min · 单元 W10-3
- MLIR tensor值语义 · 25min · 单元 W11-3
- 64位字段与16字节格式 · 25min · 单元 W11-4
- 项目CMake、CTest与Threads构建选项 · 15min · 单元 W05-5
另有12套面试训练共48h、12套求职工作坊共60h。它们按已学里程碑开放入口,和核心时间分别记录。复盘、缓冲、设备等待与额外补课依实际需要安排;不预设每周投入。
包含预留时间时怎样核算总投入
非核心预算另列195h:面试60h、求职75h、复盘30h、缓冲30h。现有完整训练材料是48h+60h,其余87h由面试重复12h、求职跟进15h、复盘30h与缓冲30h组成,不是新增87h教材。
核心、全部补授(含可选10min)及这些预留合计547h。这是预算换算,实际每周容量尚未确认,不作为完成期限。
拥有一组数据:array、vector与string
独立创建/读取/追加和复制;用普通下标for完成相加前范围检查。尚不接原stage01或01-b整文件的范围for,也不提前用view。
遍历与借用:范围、视图与失效;M1
解释遍历、视图期限与失效;新09完成后进入独立M1,通过后再进新10。非法访问只分析,不预测未定义行为的输出。
算法与lambda:表达处理意图
写安全谓词/比较器/短回调并解释是否修改容器;不用移动捕获和包装器。
真实资源与RAII:独占拥有
解释并实现独占管理和转交,指出每条退出路径的释放责任;不考多态销毁。
错误处理与输入解析
解析合同、失败检查、异常清理;解释noexcept边界。
测试与调试:独立定位失败
独立编码、边界检查、定位首个偏差并口述;本章5.5h保留全部测试/调试教学,完整G0另计10h,继承/virtual不入考核。
系统入口与顺序主项目
跨过 C++ 与操作系统的接口;虚拟地址算式与真实映射的不同证据;把共享状态放到明确的锁协议里;现在再学习数组与哈希算法;开始唯一主项目的顺序正确性
系统模块:关闭、发布、二分与图
关闭协议、发布关系与算法边界
架构、测量与通用分区
缓存行与逻辑 SIMD 的边界;先保留样本,再谈平均与加速;把两个固定任务推广为完整分区;用状态定义约束动态规划;用主项目回答一个性能问题
并行算法与GPU执行模型
Reduction 与 scan 保留不同信息;异步提交延长了谁的寿命;每个有效索引恰好被处理一次;地址区域与同步范围不能靠猜;用 shape 与 stride 接上矩阵计算
AMD与Tenstorrent入口
把已会的索引和寿命映射到 HIP;用 event 表达具体生产位置;ROCm 故障该回到哪一层;两级 reduction 与一个 profiling 假设;从二维坐标到 TTNN 与 Metalium
显式数据流与Cerebras
Circular buffer 的预留、发布与释放;同一矩阵结果穿过三段数据流;先分配 PE 的数据,再读 CSL host 生命周期;跨 PE scan 的消息必须包含什么;用独立 oracle 分清模型、simulator 与设备
Compiler与runtime
从表达式树走到真实编译器输出;先找反例,再讨论优化合法性;旧值、活跃区间与 buffer 复用;ABI、符号与模块生命;把编译器责任接回同一主项目
复现、答辩与下一专项
从干净目录复现自己的结果;系统设计题从四个状态量开始;让性能结论经得住追问;三家公司用同一个问题回答;陌生变体、英文答辩与下一阶段选择
什么时候可以进入系统实践?
如果已有完整G0通过证据,从SYS-00系统入口接续,再进入保留的后段。经验年限只是诊断线索,跳过基础必须有实际证据。
完整G0要求概念至少80%,引用、ownership、dangling和失效等关键题正确;独立完成陌生程序,保存严格编译、Debug/Release、测试与适用Sanitizer结果,并口述接口、生命周期与调试过程。M1只检查前半段,不代替完整G0。
打开完整G0挑战流程 →厂商专项另选,不压进共同路线
三家公司各有8个进阶单元,每个4h;每家公司32h,全部额外 96h。先选一家,再依据岗位和实际反馈决定是否深入下一家。设备实验按条件标明SDK、simulator与硬件状态。
基础路线约 13%;三家进阶都选后约 31%。分母随额外时间一起增加。
条形表示比例,具体小时数写在旁边。这是计划投入;设备验证与独立掌握另按实际结果判断。