Skip to content

GitHub 补充学习资源

这一页不是要把你扔进资源海里,而是帮你筛掉大部分噪音。下面这些仓库,我只保留了官方仓库、主流工具仓库和确实适合教学补充的项目。用法也不是"全部看完",而是按课程阶段,每次只补 1 到 2 个。

先说结论。

课程本体负责把知识讲顺、讲细;GitHub 资源负责让大家看到真实代码、真实项目结构、真实工具用法。两者配合起来,学习会更扎实。但如果一开始就四处搜仓库,十有八九会越看越乱,所以这里直接按你的课程顺序把资源分好了。

02. 先立一个不乱的学习规则

规则一:一章课最多配两个仓库

比如学 API 实操时,就只补 openai-pythonopenai-cookbook;别再同时打开十几个教程仓库。你是来补理解,不是来逛街。

规则二:先看 README 和 examples

大部分新手一上来就看源码,结果立刻被目录结构劝退。更稳的顺序是:README → quickstart → examples → 再决定要不要进源码。

规则三:看仓库要带着问题看

比如你在学 LangGraph,就带着"状态怎么传""分支怎么走""中断怎么做"这几个问题去看,不然很容易看了半天却没留下东西。

规则四:资源页不是必修清单

这页更像"备用弹药库"。谁觉得某一块没吃透,就去拿对应那一组资源,不需要照单全刷。

课程主线先学 → 卡住时补 1-2 个仓库 → 做一个小 demo → 回到课程继续

03. 入门与 API

这一组适合刚学完"基础认知 / Python / AI API 实操"的同学。目标不是学花哨能力,而是看到真实 SDK 和真实示例怎么写。

资源适合什么时候看重点看什么使用建议
microsoft/generative-ai-for-beginners刚入门,大模型概念还比较散的时候课程式目录、GenAI 基础、Prompt、RAG、Agent 入门把它当辅助教材,不要跳着刷,挑和你当前课程对应的章节看
openai/openai-python学 API 调用、想看官方 Python SDK 写法的时候README、安装方式、聊天调用、流式输出、文件结构重点是学"官方推荐姿势",不是让你把仓库源码读完
openai/openai-cookbook已经能调通 API,想看更多实战例子的时候示例 notebook、结构化输出、评测、RAG、工具调用按场景搜案例最合适,比如只找 eval、RAG 或 function calling

这一组最容易犯的错。

很多人会把 openai-cookbook 当系统课程从头看。其实没必要。它更像"案例库",你学到哪个知识点,就回去翻对应案例,效率更高。

04. 测试与评测

这一组和你的主线课程最贴。它们不只是"能跑",更重要的是能帮助大家建立大模型测试的工程视角:怎么评测、怎么回归、怎么做红队、怎么量化效果。

资源更适合补哪一章重点看什么使用建议
openai/evalsAI 功能测试、Prompt 工程、评测工程化评测框架、基准集、结果比较思路适合建立"评测不是拍脑袋"的意识,先理解框架,再考虑是否引入
promptfoo/promptfooPrompt、RAG、红队、安全专项Prompt 对比、自动评测、红队扫描、CI 集成特别适合教学演示,因为它能把"改一版 Prompt 后效果如何"快速展示出来
vibrantlabsai/ragasRAG 专项评测Faithfulness、Answer Relevancy 等 RAG 评测指标不要把它当万能评分器,更适合拿来理解 RAG 评测维度和自动化评估思路

05. LangChain / LangGraph / Agent

这一组最好放在专题阶段看。先学完课程里的概念和例子,再去仓库里看最小 demo,会顺很多。

资源适合什么时候看重点看什么使用建议
langchain-ai/langchain学完 LangChain 入门后Runnable、Prompt、Tool、Parser、示例目录先找最小链路示例,不要一上来就去啃全部模块
langchain-ai/langgraph学完 LangGraph 专题后StateGraph、节点、边、checkpoint、中断恢复带着"为什么它适合复杂流程"这个问题去看,会比机械看 API 更有效
openai/openai-cookbook想补 Agent、tool calling、structured outputs 的时候官方示例和使用模式它虽然不是 LangChain 仓库,但特别适合用来补"基础能力原型怎么搭"

这里最重要的提醒。

LangChain 和 LangGraph 仓库都很大。教学上不应该让大家"通读仓库",而应该指定入口:先跑一个最小 demo,再去找和当前知识点对应的目录,不然很容易被框架复杂度吓住。

06. Transformer 与训练

这一组专门给"原理党"和"想把底层真正吃透"的同学。你前面已经要求把 Transformer 放到专项深入里,这组资源就正好作为这个专项的延伸阅读。

资源适合补什么重点看什么使用建议
huggingface/courseTransformer 入门、Tokenizer、Pipeline 概念课程目录和配套练习适合拿来补课,不适合拿来替代你的专项正文
huggingface/transformers模型加载、推理、训练接口README、examples、常见模型实现入口新手重点看 examples 和文档链接,别急着进每个模型类的源码
huggingface/trlSFT、RLHF、偏好优化训练脚本、trainer 设计、偏好数据训练思路适合在你已经理解"训练目标"和"对齐"后再看
huggingface/accelerate多卡训练、分布式、混合精度启动方式、设备抽象、训练脚本适配更适合想理解训练工程的人,不是第一阶段必看
deepspeedai/DeepSpeed大模型训练优化、显存和吞吐问题ZeRO、分布式训练、推理优化这个仓库偏工程,适合专项深挖时再补,不建议零基础直接冲

07. Web / 移动端 / 性能

这一组是给 SDK、Web、移动端、H5 和性能测试配的。你前面提得对,这些端不该只是一笔带过,所以补充资源也按对象拆开。

资源适合补哪一块重点看什么使用建议
microsoft/playwrightWeb 端、H5 自动化浏览器自动化、断言、录制、trace、跨浏览器很适合补 Web 端 AI 测试里的上传、流式渲染、前端回归
appium/appium移动端自动化跨平台移动测试、元素定位、手势、设备控制适合和你的移动端专项一起学,重点理解自动化边界和不稳定点
grafana/k6接口性能、AI 接口压测脚本化压测、指标采集、结果输出如果团队已经有性能测试需求,它是很适合落地演示的工具
locustio/locustPython 风格性能测试用 Python 写负载逻辑、用户行为编排对已经学过 Python 的同学更友好,适合和课程性能篇配合练手

多端这组资源怎么用最稳。

先学你的课程页,把测试对象、场景和风险点理顺;然后只选一个自动化工具仓库去补。比如学 Web 就看 Playwright,学移动端就看 Appium,别同时把四五个框架都打开。

08. 一份不容易乱的补充节奏

你当前学到哪建议补哪个为什么这样配
学完 Python 与 AI API 实操openai-python + openai-cookbook一个看官方 SDK 姿势,一个看真实示例,够用了
学完 AI 功能测试 / Promptopenai/evals 或 promptfoo开始建立自动评测和回归意识
学完 RAG 专项ragas把 RAG 评测指标从概念变成工具认知
学完 LangChain / LangGraphlangchain + langgraph回到官方仓库看最小 demo,理解框架真实结构
学完 Transformer 与训练原理huggingface/course + transformers一个补教学,一个补工程入口
学 Web / 移动端 / 性能专项playwright / appium / k6按对象选工具,不要混着补

最后一句建议。

真正能让大家学到很多的,不是资源越多越好,而是每个阶段都知道"我现在该补什么,不该补什么"。所以我这次没有堆一堆所谓的 awesome 列表,而是尽量按你的课程顺序,只留那些最能接得上的仓库。

09. 偏见与公平性测试(对应第46篇)

这一组聚焦"模型在性别 / 种族 / 地域 / 职业等维度是否存在系统性偏差"。看仓库时不要陷在指标公式里,先用它给的题库跑一遍,再去看怎么定义"歧视"。

资源类型 Tag重点看什么使用建议
nyu-mll/BBQ偏见基准 · 学术问答式偏见数据集(9 个社会维度)、模板生成思路当作"偏见测试集长什么样"的样板,先理解题型再谈指标
huggingface/evaluate评测库 · 高 star内置的 fairness、toxicity、honest 等指标实现不需要自己造轮子,先翻 measurements 目录看有没有现成指标
google-research/google-research研究合集 · 子目录子目录 tree/master/bias-bench :内在偏见基准对比整个仓库非常大,只看 bias-bench 子目录即可
openai/evals评测框架 · 官方evals/registry/data 下的 bias / fairness 类用例把它和 BBQ 配合看:BBQ 提供数据,evals 提供运行框架
Trusted-AI/AIF360公平性工具包 · IBM 出品群体公平性指标、缓解算法、偏见检测流程原 IBM/AIF360 已迁移到 Trusted-AI 组织;适合补"公平性指标体系"
jaketae/word2bias词向量偏见 · 教学词嵌入维度的性别 / 职业偏见可视化体量小但思路清晰,适合在课程里做 5 分钟现场演示

10. LLM Benchmark 实操与污染防控(对应第47篇)

"刷榜"和"测试"不是同一件事。这组仓库帮你把基准测试做成"可复现 + 不被训练污染"的工程动作。

资源类型 Tag重点看什么使用建议
EleutherAI/lm-evaluation-harness评测框架 · 高 star任务定义、prompt 模板、批量跑分、复现脚本当今英文榜的事实标准,先跑一个 task 再读源码
open-compass/opencompass中文评测 · 高 star中英双语任务、自定义模型接入、报告生成国内团队首选;和 lm-eval-harness 二选一即可,不要都装
mlcommons/inference性能基准 · 工业MLPerf Inference 的负载、SUT 设计、合规性脚本聚焦"吞吐 / 延迟"基准,而不是"准确率"基准
princeton-nlp/SWE-bench代码 Agent 基准 · 学术真实 GitHub issue 修复任务、Verified 子集、评测沙箱SWE-bench 官方实现位于 princeton-nlp 组织;想做代码 Agent 必看
lmarena/arena-hard-auto对战式评测 · 主流500 道高区分度难题、GPT-4 作为 judge 的偏差校正仓库实际名为 arena-hard-auto;适合补"对战式评测怎么避免裁判偏好"
simple-bench/SimpleBench反污染基准 · 新对人类简单 / 对模型困难的题型设计、防泄漏策略题量小但思路独特,配合 lm-eval-harness 一起跑

11. 数据隐私与 PII 泄露测试(对应第48篇)

这组重点不是"能不能识别 PII",而是"模型会不会把训练数据吐出来 / 训练流程能不能给出隐私保证"。

资源类型 Tag重点看什么使用建议
microsoft/presidioPII 识别 · 工业PII 识别器、匿名化、自定义实体扩展做"上线前 PII 扫描"的事实选择,先看 quickstart
privacytrustlab/ml_privacy_meter隐私审计 · 学术成员推断攻击 (MIA) 的标准实现、攻击 / 防御对照用来回答"训练数据是不是被记下来了"这个问题
ftramer/LM_Memorization提取攻击 · 经典论文训练数据提取攻击的最小实现、复现脚本论文配套代码,看完能理解"为什么大模型会逐字吐训练数据"
OpenMined/PySyft联邦 / 隐私计算 · 高 star差分隐私、联邦学习、隐私计算工程化替代"jagielski/auditing-dpsgd"该仓库较冷门;这个更主流
pytorch/opacus差分隐私训练 · PyTorch 官方DP-SGD、隐私预算(ε, δ)追踪、Hooks 实现想验证"我们说的差分隐私真的有效吗",从 opacus 入手
tensorflow/privacy差分隐私训练 · TF 官方DP 优化器、成员推断测试套件有 TF 栈选这个,PyTorch 栈选 opacus,不用都看

12. 量化与推理引擎差异性测试(对应第49篇)

同一个模型权重,跑在不同推理引擎 / 不同量化精度上,输出可能完全不同。这组帮你建立"差异性回归"的工程意识。

资源类型 Tag重点看什么使用建议
vllm-project/vllm推理引擎 · 高 starPagedAttention、连续批处理、AWQ / GPTQ 集成线上吞吐基线选这个;测试时关注采样参数对一致性的影响
sgl-project/sglang推理引擎 · 新兴RadixAttention、结构化输出、多模态后端和 vLLM 做 A/B 对比,能看出推理引擎对输出稳定性的影响
NVIDIA/TensorRT-LLM推理引擎 · NVIDIA 官方FP8 / INT4 量化、TRT 引擎构建、Triton 部署N 卡生产环境必须了解的引擎,先看 examples
huggingface/text-generation-inference推理服务 · HF 官方Rust 服务端、量化适配、Watermark / Guidance注意 license 是 HFOIL,不能商用部署,但学习无障碍
ollama/ollama本地推理 · 现象级一行命令拉模型、Modelfile、OpenAI 兼容 API做"端到端 demo"和教学最方便的本地推理工具
ggml-org/llama.cppCPU / GGUF · 现象级GGUF 格式、Q4_K_M 等量化方案、benchmark 脚本原 ggerganov/llama.cpp 已迁移到 ggml-org 组织;GGUF 量化的事实标准
ml-explore/mlxApple Silicon · 官方统一内存、Lazy 计算、转换工具苹果生态做端侧测试的首选框架
InternLM/lmdeploy推理 / 量化 · 国产TurboMind 后端、W4A16 量化、KV Cache 量化国产模型部署常用栈,和 vLLM 是另一种思路
AutoGPTQ/AutoGPTQ量化算法 · 主流GPTQ 算法实现、校准数据集、量化后评测脚本用来生成 GPTQ 量化权重;测试时配合 wikitext 跑 PPL
casper-hansen/AutoAWQ量化算法 · 主流AWQ 算法、4-bit 权重、与 vLLM / TGI 兼容和 GPTQ 做对照,体会"量化方法不同 → 输出风格不同"

13. Embedding 与向量库工程化评测(对应第50篇)

这组覆盖"embedding 模型怎么选"和"向量库怎么压"两条线。看仓库时分清楚:MTEB 是评测,FlagEmbedding 是模型,剩下是基础设施。

资源类型 Tag重点看什么使用建议
embeddings-benchmark/mtebEmbedding 评测 · 标准56 个数据集、8 类任务、自定义模型接入选 embedding 模型时一定要先看 MTEB 排行榜
FlagOpen/FlagEmbeddingEmbedding 模型 · 国产BGE 系列、reranker、长文本嵌入中文项目首选;还提供 finetune 脚本,可做"垂直领域微调"
milvus-io/milvus向量库 · 高 star分布式架构、HNSW / DiskANN、性能调优大规模生产场景必看;测试关注 recall / QPS / 内存权衡
qdrant/qdrant向量库 · Rust过滤式向量搜索、payload 索引、量化压缩云原生场景部署轻便;适合做小到中规模的向量服务
weaviate/weaviate向量库 · GraphQL多模态、混合搜索(向量 + 关键字)、模块化带 schema 概念,适合需要结构化数据 + 向量的场景
pgvector/pgvector向量扩展 · PostgresHNSW / IVFFlat 索引、SQL 内嵌、ACID已有 PG 栈的团队首选;不用引入新数据库
chroma-core/chroma向量库 · 入门友好Python in-process、嵌入函数封装、collection 概念原型 / 教学最方便;不要拿它跑生产级负载

14. 模型升级与微调回归测试(对应第51篇)

当你换模型版本、做完一次 LoRA、调完一版 prompt,到底"变好了"还是"暗中坏了"?这组工具就是回答这个问题的。

资源类型 Tag重点看什么使用建议
huggingface/peft参数高效微调 · HF 官方LoRA / QLoRA / IA³ / Prefix Tuning 实现微调入口,看 examples 即可;回归测试要在微调前后两套权重上跑
huggingface/trl对齐训练 · HF 官方SFT、DPO、PPO、GRPO trainer偏好优化后特别容易出回归,做完一次 DPO 必跑安全测试
mlflow/mlflow实验管理 · 高 starexperiment、run、artifact、model registry做版本对比的基础设施;不用 MLflow 也要有等价的方案
langchain-ai/langsmith-sdk评测 / 追踪 · LangChaindataset、experiment、evaluator 三件套原 langsmith-sdk-python 已合并入 langsmith-sdk 多语言仓库
promptfoo/promptfooPrompt 评测 · 高 starYAML 用例、CI 集成、新旧模型 diff 报告"换模型版本"这件事最直接的回归工具,配 GitHub Actions 用
BerriAI/litellm统一 SDK · 高 star100+ 模型一致接口、callback、cost tracking做"同一套用例跑多个模型"对照实验时极其方便

15. 测试数据合成与用例自动生成(对应第52篇)

"没有数据怎么办"基本上是大模型测试的第一难题。这组工具帮你用 LLM 反向造数据。

资源类型 Tag重点看什么使用建议
argilla-io/distilabel合成数据 · 主流Pipeline、LLM 蒸馏、preference 数据生成做 SFT / DPO 数据准备时几乎是首选
argilla-io/argilla数据标注平台UI、人审流程、与 distilabel 联动合成完后必须有人审一轮,argilla 就是这一轮的工具
yizhongw/self-instruct自指导生成 · 经典种子任务 → 扩展 → 过滤 的三步法看思路而不是看代码,2026 年实操工具更成熟
nlpxucan/WizardLM难度演化 · 经典Evol-Instruct:把简单问题"演化"成复杂问题用来生成"难样本"覆盖测试盲点,思想很重要
confident-ai/deepevalLLM 单元测试 · 高 star14+ 评测指标、pytest 集成、合成数据器把 LLM 评测做成"像跑 pytest 一样",强烈推荐先试
microsoft/promptbench对抗扰动 · 学术字符 / 词 / 句子级扰动、鲁棒性评测用来测"prompt 加点错别字模型还能不能扛住"

16. 2026 Agent 协议测试(对应第53篇)

2025-2026 进入"Agent 协议年":MCP(工具)、A2A(智能体之间)、各家自家 Agents 框架并行。这组帮你看清协议层。

资源类型 Tag重点看什么使用建议
anthropics/anthropic-cookbookClaude 官方示例tool use、computer use、MCP 接入示例组织名实际是 anthropics 不是 anthropic;2026 看 Claude Agent 必看
openai/openai-pythonOpenAI 官方 SDKResponses API、Agents SDK、Tools2026 主推 Responses API,老的 Chat Completions 仍可用但建议迁移
a2aproject/A2AAgent 间协议 · Google 主推Agent Card、Task、Message 协议规范Google 已把 A2A 移交 Linux Foundation,仓库现位于 a2aproject
langchain-ai/langgraphAgent 框架 · 高 starStateGraph、checkpoint、人在环 (HITL)测试 Agent 流程的中断 / 恢复 / 回滚必看
microsoft/autogen多智能体 · 高 star对话式编排、GroupChat、AutoGen Studio研究多智能体协作模式时第一个看的仓库
ag2ai/ag2AutoGen 社区分叉从 microsoft/autogen 分叉,社区主导,更新更快有些功能 autogen 还没有,ag2 已经做了,可作为对照
modelcontextprotocol/python-sdkMCP SDK · 官方Server / Client、Resource / Tool / Prompt 三类原语2026 工具调用的事实标准,Anthropic + OpenAI 都已支持

17. 实时语音视频流测试(对应第54篇)

实时多模态的测试和文本测试完全不是一回事。这组覆盖端到端语音、VAD、ASR / TTS 三块。

资源类型 Tag重点看什么使用建议
openai/openai-realtime-api-beta实时 API · 官方参考WebSocket 协议、音频帧编码、打断 / VAD看协议时序图;测试关注首字延迟和打断及时性
google-gemini/cookbookGemini 官方示例Live API、视频流输入、多模态对照和 OpenAI Realtime 做协议对比,理解两家的设计取舍
snakers4/silero-vadVAD · 主流语音活性检测、低延迟、多语言实时语音绕不开 VAD,先用它做端点检测
speechbrain/speechbrain语音工具箱 · 学术ASR / Diarization / 增强 / 说话人识别需要"自己拼语音流水线"时再用,平时用 API 即可
m-bain/whisperXASR · Whisper 增强词级时间戳、speaker diarization、批量加速做语音转写质量评测时的事实标准
coqui-ai/TTSTTS · 经典多说话人、声音克隆、XTTS v2原公司虽已关停,仓库仍是开源 TTS 教学首选
livekit/agents实时 Agent 框架WebRTC 接入、turn detection、多模态 worker2026 做"语音 Agent"产品最完整的开源框架

18. AI 应用合规与备案测试(对应第55篇)

这组对应"上线前合规检查清单"——既要能挡住违法违规输出,也要能在备案 / 审计中拿出证据。

资源类型 Tag重点看什么使用建议
meta-llama/PurpleLlama安全工具集 · Meta 官方Llama Guard、CyberSec Eval、Code Shield看 Llama Guard 怎么定义 13 类违规;可直接复用其分类法
guardrails-ai/guardrails输出守卫 · 高 starRAIL spec、validators、re-ask 机制做"输出格式 + 内容双重护栏"很顺手
NVIDIA/NeMo-Guardrails对话护栏 · NVIDIAColang 语言、topic / safety / fact rails对话型应用的多轮护栏首选;学习曲线略陡
mlcommons/modelbenchAILuminate 基准 · 行业12 类危害评测、A-E 等级评分AILuminate 的运行器实际位于 mlcommons/modelbench 仓库
thu-coai/SafetyBench中文安全基准 · 学术7 类安全维度、中英双语题库替代原"explosion/safetybench"(不存在);国内合规测试必备
tatsu-lab/alpaca_eval自动评测 · 学术LLM-as-judge、长度偏差矫正、leaderboard需要"自动出报告"时的轻量方案,配合人审一起用

19. 端侧 AI 与小模型测试(对应第56篇)

2026 端侧推理已经从"玩具"变成"刚需"。这组覆盖 Apple / Web / 移动 / 跨平台四条路径。

资源类型 Tag重点看什么使用建议
ml-explore/mlx-lmApple 端侧 LLM · 官方mlx_lm.generate / server、量化、LoRA从 mlx-examples 拆出来的独立仓库,Mac 上跑 LLM 最简洁
ggml-org/llama.cpp跨平台端侧 · 现象级GGUF、Metal / CUDA / Vulkan 后端、benchmark端侧测试的"瑞士军刀",移动 / 桌面 / 嵌入式都能跑
mlc-ai/mlc-llm编译式部署 · 高 starTVM 编译、iOS / Android / WebGPU 全打包想真正发到 App Store / Play 上跑,看这个
microsoft/onnxruntime跨平台推理 · 高 starONNX 模型转换、QDQ 量化、ORT-GenAI企业级跨平台部署的稳定方案
huggingface/transformers.js浏览器内推理 · HF 官方WebGPU / WASM 后端、Pipeline API、模型转换纯前端跑模型最直接的方案;做 H5 demo 极合适
apple/coremltoolsCore ML 转换 · Apple 官方PyTorch / TF → Core ML、ANE 优化、量化iOS 应用要走 ANE,必经 coremltools 这一步
google-ai-edge/mediapipe端侧多模态 · Google 官方LLM Inference API、视觉 / 音频任务、跨平台Google 端侧 AI 入口已合并到 google-ai-edge 组织

补充练习与参考答案

补充练习

  1. 假设你刚学完 Python 与 AI API 实操,列出你会优先看的 2 个仓库,并说明理由。
  2. 如果你当前目标是补 RAG 评测能力,你会怎样安排一周的练习顺序?
  3. 为什么"资源越多越好"对初学者反而可能是坏事?

参考答案要点

  • 实操阶段优先官方 SDK 和 cookbook,目标是先跑通、先看懂,而不是一开始就陷入复杂框架。
  • RAG 学习顺序通常应是:先理解检索评测指标,再看最小 demo,最后自己做一组 query-doc 的回归测试。
  • 资源过多会让人不断切换上下文,最有效的方法是每个阶段只选最接得上的 1 到 2 个仓库。

返回课程首页 回到主线开始学习 →

GitHub 补充学习资源 大模型测试体系教程 · 配套学习导航

上次更新: