CAPABILITY / EVIDENCE
能力地图
不用百分比给自己打分,只记录当前判断、做过的事、失败边界和下一步。
高性能计算与ai基础设施
我把超算理解为一套共同约束:处理器与存储层级决定单节点上限,并行模型决定如何拆分问题,通信、同步和 I/O 又决定扩展效率。AI Infra 是这套认识在模型训练与推理工作负载上的延伸
竞赛经历
- 2024 IndySCC 线上赛第三名
- 2025 ASC 二等奖。
- 2024 先导杯没名次
围绕 AlphaFold 做过环境搭建、运行链路梳理和优化尝试,观察依赖、数据准备与计算阶段对整体耗时的影响。
对 vLLM 等推理基础设施做过代码阅读和实验性尝试;涉及 fork 的部分只作为研究过程,不视为原创项目。
我的理解
应用的性能与行为最终会落到指令执行、缓存与内存、并发同步、系统调用和资源调度上。体系结构解释“机器如何执行”,操作系统解释“资源如何被抽象和管理”,两者需要通过实验连接,而不是只背概念。
做过的事
- 使用 Docker 组织过包含 Hadoop、HBase、Hive、Spark 与 Flink 的大数据实验环境,处理服务依赖、配置和启动顺序。
- 在超算与性能实验中接触过 CPU、GPU、内存与 I/O 对工作负载的影响。
- 一直想做一生一芯...
边界与失败
我还没有独立完成处理器核、内核或完整系统软件,现阶段更接近“能把已有知识用于排查和实验”。对微结构、编译器与操作系统之间的定量联系仍不够扎实,一生一芯也不能在完成前写成成果。
下一步
沿一生一芯路线完成可运行、可调试的阶段性设计,并用性能计数、反汇编和系统跟踪工具把上层现象对应到底层机制。
啥是hacker?
我想这篇http://catb.org/~esr/faqs/hacker-howto.html 对我的影响深远
一辈子忘不了
多年以后,登上某个服务器,我仍会想起大二的一个下午,我用 nvtop 看 GPU 进程,一个叫 py2.8 的陌生进程运行了一会儿就消失了,起初我以为只是其他人在跑任务,没细想就关了电脑美美吃饭去了;当我嘴里咀嚼着热辣的冒菜时,一股冷意却突然直冲天灵盖,python 哪有2.8?进一步排查后,我们确认这是影响了多台机器的挖矿病毒。
众所周知
嵌入式好玩捏
做过的事
- FPGA 智能小车团队项目,使用 VHDL 与 Verilog 组织控制逻辑并做联调。
- 持续维护过数字逻辑实验辅助内容,把实验步骤、常见错误和验证方式整理成可复用材料。
算法与数据结构
做过的事
- 在 LeetCode 上做过大约 50 道题,接触数组、链表、栈、队列、树、哈希、排序、搜索和基础动态规划。
下一步
刷刷题目打打周赛,虽然确实不想刷题hehe...