项目
近三个月的活儿,按类型分组、从最有分量的排起。每个卡片点进去是这个项目怎么从零跑起来、踩过哪些坑的复盘。
实习项目
1真实企业实习,从数据到部署的完整工程链路。
- 内容合规质检模型微调(实习) 2026-04 ~ 2026-05
把 Qwen2.5-14B 微调成按平台规则做内容合规质检、并精确溯源到具体规则的模型,覆盖四平台。从 exp_005 一路折腾到 exp_010,真正的难点是搞清楚溯源率到底该怎么算。
→ 实习期间独立完成 6+ 次微调实验 + 三阶段推理 + AWQ 量化部署;识破 loss、准确率、溯源率多重假象
- Qwen2.5-14B
- QLoRA
- DeepSpeed ZeRO-2
- vLLM
- AWQ INT4
竞赛作品
12七牛云、智联等比赛里做的东西。
- 语音日历 2026-05
说一句话就能记日程。Azure 语音转文字 + 自写中文时间解析 + 冲突检测,端到端把口语变成结构化日程。22 个 PR、153 个测试全绿,连第三方返回的数组顺序变了都被一个虚惊抓出来。
→ 自写中文时间解析三层兜底引擎,推翻 BRIEF 预设的 dateparser 主方案;22 PR / 153 测试全绿
- FastAPI
- Azure Speech
- DeepSeek
- SQLAlchemy
- Docker
- pytest
- 多平台内容发布工具 2026-05
一份内容一键适配到多个平台。AI 起草按成本分两段路由,真发布做成诚实版的导出成品包。过程里把外部依赖耗尽、流式空 chunk、中文文件名 500、甚至手滑删掉线上视频都踩了一遍。
→ Adapter 插件化架构,加一个平台只写一个约 100 行子类;起草成本路由 + 诚实版导出
- FastAPI
- SQLite
- DeepSeek
- Playwright
- Docker
- 声绘 VoiceDraw:一个会画画的 Agent 2026-06
纯语音控制的命令式绘图 Agent。技术含量不在「语音转图」,在把绘图变成结构化推理 + 工具调用——画布即记忆,LLM 推理的是 JSON 不是像素。不是文生图,是能跟你对话改图的设计师 agent。
→ 纯语音→STT→DeepSeek tool-use→SVG 增量渲染全链路上线;感知首帧 p50≈1.48s、完成 p50≈5.35s;10 个工具、SVG/PNG/PSD 三格式导出、约 27 PR、39 commit
- FastAPI
- React
- TypeScript
- DeepSeek
- Azure Speech
- SVG
- Caddy
- AI 代码审查工具 2026-06
拉一个真实 PR 自动审出问题。核心不是能报问题,而是不乱报——两段式模型路由控误报,对一个正确的已合并 PR 实测 0 误报,对故意塞 bug 的 PR 6 个候选丢 2 留 4。
→ deepseek-chat 扫候选 + deepseek-reasoner 逐条确认 + Azure 高危交叉验证;正确 PR 0 误报
- FastAPI
- DeepSeek
- Azure GPT-4.1-mini
- React
- Docker
- Screenwright:小说转剧本工作台 2026-06
把一部小说自动转成结构化剧本(YAML),还能行级溯源回原文、按媒介(电影/剧集/短剧)重渲染、把内心戏外化成镜头语言。技术含量不在调 API,在四个工程取舍。
→ 行级双向溯源(LLM 抄 marker、代码定位)+ 有序判别联合 schema + story_bible 单一事实源;103 单测、32 PR
- FastAPI
- pydantic
- YAML Schema
- React
- DeepSeek
- 具身智能黑客松:人形运控 + VLA 操作双赛道 2026-06 ~ 2026-08
北京人形机器人创新中心 + 百度智能云「具身智能机器人黑客松」的单人参赛复盘。一条腿是 TienKung-Lab 复杂地形运控,一条腿是 ACT 五任务操作。两赛道都在截止前提交,但都没有官方成绩。真正值得写的是两起工程险情(限时算力到点销毁、1292 字节差点报废整条 VLA 腿)和一次 reward 涨了一倍、机器人其实在原地踏步的假象。
→ 两赛道均在截止前完成提交:运控自测净前进 0.209 m/s、直立 71.6%;VLA 五任务各约 25 次执行全部 task-ok。无官方成绩,VLA 闭环成功率约 0 且已诊断到底
- Isaac Sim 5.1
- IsaacLab 2.3
- TienKung-Lab
- AMP/RSL-RL
- ACT
- PyTorch
- ONNX
- MuJoCo
- ZMQ
- 保障大脑:大型活动要加多少基站,让公式算、让 AI 写 2026-06
某 AI 创新赛参赛作品。大型活动通信保障智能体——给定人数,确定性工程模型(Erlang B 语音 + 5G 吞吐)算出要临时加多少基站、多少应急通信车,AI 只负责把硬数字翻译成方案、再用异构第二个 AI 交叉验证。核心是「计算与 AI 分离」:数字有据可查,AI 碰不到、也就编不了。
→ Erlang B + 5G 吞吐双轨算基站/通信车 + 异构双 AI(GLM 生成 / Azure 验证);5 万人场景校准后落到 16 站 6 车(校准前 201 站 67 车);已上线
- FastAPI
- React
- Leaflet
- 智谱 GLM
- Azure OpenAI
- Docker
- 春招平行宇宙:用 LLM 模拟整个就业市场 2026-05
不优化求职流程,而是重构求职市场结构——把简历变成数字分身,扔进一个 49 家公司、200 个竞争者的虚拟招聘宇宙跑完整春招。这篇也记了一次 LoRA 该不该用的三轮反转,和一个我必须诚实处理的'1000次'。
→ 结构性反转的产品立意 + 全 LLM 模拟人才市场(49 公司/200 竞争者);含 LoRA 三轮决策反转的诚实复盘
- Multi-Agent
- DeepSeek
- Vue3
- Three.js
- FastAPI
- 书生国智科探挑战赛:四条线并行,国产 GPU 上的算子与量子模拟 2026-07 ~ 2026-08
上海人工智能实验室 × 壁仞科技办的科探挑战赛,我同时开了四条赛道线:模型与算子(国产 GPU 上的 SpectralConv2d 与 FNO)、量子计算(自研状态矢量模拟器 + 相变研究)、自由赛道(论文统计复核工具)、地球科学(未完成)。三条线在截止前完成提交。评审在 09 月,写作时没有任何外部评分。真正的料是平台适配的地雷清单、几次自己推翻自己的诊断,以及一套「自召红队」机制打掉的两条自证。
→ 四条线并行,三条在 07-31 截止前完成提交;评审在 09 月,写作时无任何外部评分;所有数字均为自测与自召红队产出
- PyTorch
- 国产 GPU
- torch.extension
- FFT
- FNO
- Navier-Stokes
- Qiskit
- scipy
- 多 Agent 编排
- 禁用向量检索、限调 Qwen:金融长文本问答 Agent 2026-07
天池 AFAC2026 金融赛的一道硬约束题——只能调通义千问、不许微调、禁一切 embedding 向量检索,还有 500 万 token 的硬预算,去答五类金融长文档的选择判断题。A 榜两次真实提交 58 到 65 分,真正的料是挖出来的六个检索/解析 bug,和一次我自己武断判断埋下的隐性大坑。
→ 禁 embedding、限调 Qwen、500 万 token 预算下做金融长文档 QA;A 榜提交 58→65(准确率约 61%→69%,超官方 baseline 49%);挖修 6 个真实检索/解析 bug,含一次自己抽查 3 题就武断跳过 HTML 致监管领域只索引到 1.2% 文档
- 通义千问 Qwen
- BM25
- 条款索引
- PyMuPDF
- jieba
- RAG
-
「2026 世界机器人运动会实训营」xMimic 选拔挑战的提交作品。在 Isaac Sim + RSL-RL PPO 上让 DexEVT 人形机器人做 motion tracking:先复现官方示例舞蹈,再用公开数据集 LAFAN1 经 xGMR 重定向做自定义迁移。最硬的料是 reward 全程冻结的根因(24-body vs 39-body 不匹配),和一条「冲炫撞墙、退回稳健」的真实工程曲线。
→ Isaac Sim + RSL-RL PPO 训 DexEVT 人形动作模仿;自定义迁移(LAFAN1→xGMR)aim 动作终止率 3% / reward 17;核心坑是 24-body vs 39-body 不匹配导致 reward 冻结、机器人秒倒
- xMimic
- Isaac Sim 5.1
- Isaac Lab
- RSL-RL PPO
- DexEVT
- LAFAN1
- xGMR
- ONNX
-
一个测井地质导向的回归赛,我认真做了十几版,公榜 RMSE 14.759,倒数四分之一,没进牌区。但这次复盘不是关于名次,是三件我把过程讲透了的事:一次教科书级的 CV 口径纠错、一次亲手发现又亲手证伪的数据泄漏、以及一个系统性证明'曲线匹配打不过一条平线'的负面结果。
→ 测井 TVT 回归公榜 RMSE 14.759(约倒数 25%,未进牌区);但跑通了 CV 评分口径纠错、亲手发现并证伪一处 train/test 数据泄漏、系统性证伪'geosteering 曲线匹配打不过 flat 外推基线'
- LightGBM
- CatBoost
- GroupKFold
- Kaggle
- 特征工程
面试项目
5面试中独立完成的作品,公司与题目已脱敏,保留技术方案。
- 房产租赁 RAG 知识库 2026-05
一个房产租赁领域的检索增强问答系统。混合检索加重排是基础,真正的差异化在于一套自建评测集——它让我能用数字证明换了真实 embedding 后效果从 0.32 跳到 0.85,而不是凭感觉。
→ 自建 30 题 8 场景评测集;mock→真实 embedding 双跑对比 Recall@5 从 0.317 升到 0.850
- RAG
- Qdrant
- bm25s
- 智谱 embedding
- bge-reranker
- FastAPI
- 政务工单智能处理流水线 2026-05
300 条政务热线工单,自动拆事项、抽四要素、四级分类、识别群诉。把通用性做进架构,而不是堆三条冗余流水线——群诉的双路召回里,3276 条全靠向量捞回,证明了这个设计。
→ 群诉双路召回(点位∪向量)中向量独捞 3276 条;规模化候选对仅占朴素两两的 0.36-0.49%
- Strategy模式
- faiss
- 智谱 embedding-3
- DeepSeek
- GLM-4.6
- HR 简历筛选系统 2026-05
给做外包招聘的 HR 朋友用的简历筛选工具:AI 负责语义理解、代码负责严格匹配。一个'短 JD 把真没经验的人排到前面'的 bug,逼我加了一层 LLM 布尔判断,也让我想清楚 embedding 相似度什么时候不够用。
→ 硬条件精确匹配 + 语义偏好分离;用 LLM 布尔判断层修掉短 JD 排序错乱,把区分度从差 1 分拉到差 27 分
- FastAPI
- PostgreSQL
- pgvector
- 智谱 GLM
- Streamlit
- 在线教育解题挑战赛:四道题全做 2026-05
一个在线教育平台的招聘挑战赛,四道独立的产品 PRD + 可运行代码题。我四道全做了,每道独立打包。最有意思的不是功能,是一个让会话永远卡死的状态机 bug,和一次'死按钮'其实是浏览器缓存的曲折排查。
→ 四题全做、各独立打包,约 134 单测;驯服状态机死锁、UI 自指泄漏、浏览器缓存假象等真实坑
- React
- Express
- TypeScript
- SQLite
- DeepSeek
- 盲盒订单分析工具 2026-05
给经营盲盒平台的朋友做的订单分析工具。用户想调大模型,我一行 API 都没用——纯 pandas。因为财务分析要的是精确可复现,而大模型会把 91.9 万说成 90 万。真正难的是揪出'充值订单污染了 57% 流水'这个口径错误。
→ 纯 pandas 不调 LLM;揪出充值订单污染 57% 流水的口径错误;95.8 万行 40.7 秒跑完
- Python
- pandas
- calamine
- openpyxl
开源复现
3复现前沿工作,验证技术路线、踩透框架坑。
-
在一张白嫖的 Kaggle T4 上,把 OpenVLA 7B 在 LIBERO 机器人操作基准上闭环评测全 10 任务,亲手测出 4-bit→8-bit→bf16 的量化-性能曲线。但真正的料,是 2026 新镜像跑 2024 代码趟出来的 9 个工程坑,和一次 83%→64% 的主动纠错。
→ OpenVLA 7B 在 LIBERO 闭环评测全 10 任务;量化曲线 4-bit 64% → 8-bit 76.7% → 论文 84.7%;2026 镜像跑 2024 代码的 9 个工程坑
- OpenVLA-7B
- LIBERO
- robosuite/MuJoCo
- 4-bit/8-bit 量化
- Kaggle T4
- DriveGPT4-Mini:可解释驾驶决策的 VLM 微调复现 2026-06
用 QLoRA 微调 Qwen2-VL-2B,让它对驾驶场景图输出结构化的「该怎么开 + 为什么」。一个 50 条样本的迷你复现,验证数据生成到 VLM 微调到可解释决策整条路线。真正的价值在那 7 个踩坑,和两个可迁移的 debug 心法。
→ QLoRA 微调后 loss 2.087→1.428(↓31%),7.28GB 显存跑通;7 个真实坑,含 FSDP 版本坑与 SDPA shape bug 的诊断心法
- Qwen2-VL-2B
- QLoRA
- ms-swift
- Azure GPT-4.1-mini
- RTX 4090
- Qwen2.5-3B QLoRA 微调全流程教程 2026-03
一份能在 Colab 免费 T4 上跑通的 QLoRA 教程,覆盖训练、权重合并、GGUF 量化三阶段闭环。重点是把每个参数为什么这么设讲清楚,而不是给一段能跑就行的代码。
→ 训练→合并→GGUF 量化完整闭环,每段代码标注必须改/不用改/可选改,附 5 个高发错误
- Qwen2.5-3B
- QLoRA
- GGUF
- Colab T4
个人项目
8自己起意做的工具,从零跑起来。
- AI Hub:多渠道 AI 平台 2026-04
一个开箱即用的多渠道 AI 平台:对话、文生图、用户系统、卡密充值、管理后台。把多家模型统一成一套 OpenAI 兼容接口,多 Key 轮询调度。也如实记几处巧思和几处宣传大于实现。
→ 渠道抽象 + 多 Key 轮询;extra_body 透传非标准文生图参数;流式中独立 DB session 的生命周期处理
- Vue 3
- TypeScript
- FastAPI
- SQLAlchemy
- OpenAI SDK
- 归墟 / guixu:把 AI 协作的完整过程原样存下来 2026-06
一个反 summary 的 append-only 冷存储——不做 memory、不做提炼,把 AI 协作的完整原始上下文原封不动留住,需要时整段喂给新模型去复用。赌注是:模型是 runtime,原始上下文是程序。
→ append-only 冷存储 + 运行时整段注入复用;bash/python3 零依赖;use 的逐级压缩是撞到 104 万 token 窗口墙后逼出来的
- bash
- python3
- Claude Code
- append-only
- CAD AI Agent:自然语言画 CAD 图 2026-04
用中文说一句话,自动画出 CAD 图纸(DXF)。LLM 走 function calling + ReAct 循环驱动 ezdxf 操作 2D 图纸,前端 SSE 实时展示。重点不是接通,而是把 LLM 那些不靠谱的输出一个个驯服。
→ 七层可替换抽象 + function-calling/ReAct 驱动 ezdxf;驯服了 13 类 LLM 与 CAD 库的真实坑
- FastAPI
- ezdxf
- SiliconFlow
- React
- ReAct Agent
- AI 论文排版助手 2026-01
写本科毕设时被字体格式折磨出来的工具。用 LLM 把自然语言排版指令转成 Word 样式,核心技巧是直接写 Word XML 的 w:eastAsia 槽位让中文字体生效。也如实记一段宣传大于实现的复盘。
→ 把字体映射表整张塞进 prompt 让 LLM 查表;直接操作 Word XML 的 w:eastAsia 正确渲染中文字体
- FastAPI
- Streamlit
- LangChain
- 智谱 GLM-4
- python-docx
- 内容合规检测系统:精确匹配 + 语义召回 + LLM 改写的三级流水线 2026-03 ~ 2026-06
本地化实时内容合规服务。三级流水线把「确定性零漏报」和「语义擦边召回」分层解决,命中后还产出可直接用的合规改写。最有料的是一个单测逼出来的 Aho-Corasick 空词表静默崩溃 bug,以及一整段诚实的「没在真硬件上跑过」的边界。
→ 三级流水线(AC 精确匹配 → bge-m3/Qdrant 语义召回 → Qwen2.5-7B 改写);Redis 缓存以违规词集合 SHA256 做 key、TTL 7 天、全程吞异常优雅降级;35 个纯 CPU 单测逼出 1 个 AC 空词表静默崩溃 bug
- FastAPI
- vLLM
- Qwen2.5-7B-GPTQ
- bge-m3
- Qdrant
- pyahocorasick
- Redis
- OpenCC
- pytest
- 选课抢课工具:基于反编译的协议还原 2026-05
给某学校老版正方教务系统写的抢课自动化。核心不是脚本本身,是反编译后端 DLL 拿到真实逻辑——纠正了一堆我之前靠抓包盲写的错误。也记一次把机器跑 OOM 的翻车。
→ 反编译 zjdx.dll 还原真实选课协议,纠正多处盲写错误;独立 agent 端到端审出 3 个 P0
- Python
- requests
- ddddocr
- ilspycmd
- Flask
- 招聘 JD 爬虫:让 LLM 读页面,而不是写选择器 2026-05
给一份简历,在多平台搜匹配岗位。绕过反爬的思路是让 LLM 理解页面、而不是依赖 CSS 选择器。但也得诚实记一笔:最后结果和目标严重错位——想要北京实习,爬回来全是腾讯深圳全职。
→ 双信号关键词预过滤 + LLM 解析页面绕反爬;诚实复盘一次目标与结果的严重错位
- Python
- requests
- BeautifulSoup
- LLM
- HITL 办公 Agent SaaS:可恢复状态机 + 接口驱动架构 2026-03 ~ 2026-06
一个支持人在回路(Human-in-the-Loop)的办公 Agent 示例工程。技术含量在「WAIT_USER/resume 可恢复状态机 + asyncio.Event 协程唤醒 + 40 条 pytest 覆盖安全与状态机全分支」。诚实在前:这是 AI 辅助开发的项目,我主导架构、任务拆解、review 与多轮安全加固,不是逐行手写。
→ 5 阶段可恢复状态机(IDLE→EXECUTE→WAIT_USER→resume→DONE),40 条 pytest 覆盖 JWT 伪造/过期、Fernet 加解密、沙箱目录穿越、状态机全分支;GitHub Actions 双 job CI
- FastAPI
- React
- TypeScript
- asyncio
- SQLAlchemy
- JWT
- Fernet
- pytest
- GitHub Actions
学习记录
1边学边做的过程,诚实包含没做完的。
- 深度学习速成训练营(自学日志) 2026-04
零基础三五天搞懂'训练一个模型'是怎么回事的自学项目。最有价值的产物不是代码,是全程录制的教学日志。诚实说:规划是 MNIST 到 BERT,实际只跑到了 Day1。
→ 讲→做→复盘三段式 + 全程录制教学日志;MNIST 环境与数据理解跑通
- PyTorch
- torchvision
- RTX 3090