GitHub 补充学习资源
这一页不是要把你扔进资源海里,而是帮你筛掉大部分噪音。下面这些仓库,我只保留了官方仓库、主流工具仓库和确实适合教学补充的项目。用法也不是"全部看完",而是按课程阶段,每次只补 1 到 2 个。
先说结论。
课程本体负责把知识讲顺、讲细;GitHub 资源负责让大家看到真实代码、真实项目结构、真实工具用法。两者配合起来,学习会更扎实。但如果一开始就四处搜仓库,十有八九会越看越乱,所以这里直接按你的课程顺序把资源分好了。
02. 先立一个不乱的学习规则
规则一:一章课最多配两个仓库
比如学 API 实操时,就只补 openai-python 和 openai-cookbook;别再同时打开十几个教程仓库。你是来补理解,不是来逛街。
规则二:先看 README 和 examples
大部分新手一上来就看源码,结果立刻被目录结构劝退。更稳的顺序是:README → quickstart → examples → 再决定要不要进源码。
规则三:看仓库要带着问题看
比如你在学 LangGraph,就带着"状态怎么传""分支怎么走""中断怎么做"这几个问题去看,不然很容易看了半天却没留下东西。
规则四:资源页不是必修清单
这页更像"备用弹药库"。谁觉得某一块没吃透,就去拿对应那一组资源,不需要照单全刷。
课程主线先学 → 卡住时补 1-2 个仓库 → 做一个小 demo → 回到课程继续
03. 入门与 API
这一组适合刚学完"基础认知 / Python / AI API 实操"的同学。目标不是学花哨能力,而是看到真实 SDK 和真实示例怎么写。
| 资源 | 适合什么时候看 | 重点看什么 | 使用建议 |
|---|---|---|---|
| microsoft/generative-ai-for-beginners | 刚入门,大模型概念还比较散的时候 | 课程式目录、GenAI 基础、Prompt、RAG、Agent 入门 | 把它当辅助教材,不要跳着刷,挑和你当前课程对应的章节看 |
| openai/openai-python | 学 API 调用、想看官方 Python SDK 写法的时候 | README、安装方式、聊天调用、流式输出、文件结构 | 重点是学"官方推荐姿势",不是让你把仓库源码读完 |
| openai/openai-cookbook | 已经能调通 API,想看更多实战例子的时候 | 示例 notebook、结构化输出、评测、RAG、工具调用 | 按场景搜案例最合适,比如只找 eval、RAG 或 function calling |
这一组最容易犯的错。
很多人会把 openai-cookbook 当系统课程从头看。其实没必要。它更像"案例库",你学到哪个知识点,就回去翻对应案例,效率更高。
04. 测试与评测
这一组和你的主线课程最贴。它们不只是"能跑",更重要的是能帮助大家建立大模型测试的工程视角:怎么评测、怎么回归、怎么做红队、怎么量化效果。
| 资源 | 更适合补哪一章 | 重点看什么 | 使用建议 |
|---|---|---|---|
| openai/evals | AI 功能测试、Prompt 工程、评测工程化 | 评测框架、基准集、结果比较思路 | 适合建立"评测不是拍脑袋"的意识,先理解框架,再考虑是否引入 |
| promptfoo/promptfoo | Prompt、RAG、红队、安全专项 | Prompt 对比、自动评测、红队扫描、CI 集成 | 特别适合教学演示,因为它能把"改一版 Prompt 后效果如何"快速展示出来 |
| vibrantlabsai/ragas | RAG 专项评测 | Faithfulness、Answer Relevancy 等 RAG 评测指标 | 不要把它当万能评分器,更适合拿来理解 RAG 评测维度和自动化评估思路 |
05. LangChain / LangGraph / Agent
这一组最好放在专题阶段看。先学完课程里的概念和例子,再去仓库里看最小 demo,会顺很多。
| 资源 | 适合什么时候看 | 重点看什么 | 使用建议 |
|---|---|---|---|
| langchain-ai/langchain | 学完 LangChain 入门后 | Runnable、Prompt、Tool、Parser、示例目录 | 先找最小链路示例,不要一上来就去啃全部模块 |
| langchain-ai/langgraph | 学完 LangGraph 专题后 | StateGraph、节点、边、checkpoint、中断恢复 | 带着"为什么它适合复杂流程"这个问题去看,会比机械看 API 更有效 |
| openai/openai-cookbook | 想补 Agent、tool calling、structured outputs 的时候 | 官方示例和使用模式 | 它虽然不是 LangChain 仓库,但特别适合用来补"基础能力原型怎么搭" |
这里最重要的提醒。
LangChain 和 LangGraph 仓库都很大。教学上不应该让大家"通读仓库",而应该指定入口:先跑一个最小 demo,再去找和当前知识点对应的目录,不然很容易被框架复杂度吓住。
06. Transformer 与训练
这一组专门给"原理党"和"想把底层真正吃透"的同学。你前面已经要求把 Transformer 放到专项深入里,这组资源就正好作为这个专项的延伸阅读。
| 资源 | 适合补什么 | 重点看什么 | 使用建议 |
|---|---|---|---|
| huggingface/course | Transformer 入门、Tokenizer、Pipeline 概念 | 课程目录和配套练习 | 适合拿来补课,不适合拿来替代你的专项正文 |
| huggingface/transformers | 模型加载、推理、训练接口 | README、examples、常见模型实现入口 | 新手重点看 examples 和文档链接,别急着进每个模型类的源码 |
| huggingface/trl | SFT、RLHF、偏好优化 | 训练脚本、trainer 设计、偏好数据训练思路 | 适合在你已经理解"训练目标"和"对齐"后再看 |
| huggingface/accelerate | 多卡训练、分布式、混合精度 | 启动方式、设备抽象、训练脚本适配 | 更适合想理解训练工程的人,不是第一阶段必看 |
| deepspeedai/DeepSpeed | 大模型训练优化、显存和吞吐问题 | ZeRO、分布式训练、推理优化 | 这个仓库偏工程,适合专项深挖时再补,不建议零基础直接冲 |
07. Web / 移动端 / 性能
这一组是给 SDK、Web、移动端、H5 和性能测试配的。你前面提得对,这些端不该只是一笔带过,所以补充资源也按对象拆开。
| 资源 | 适合补哪一块 | 重点看什么 | 使用建议 |
|---|---|---|---|
| microsoft/playwright | Web 端、H5 自动化 | 浏览器自动化、断言、录制、trace、跨浏览器 | 很适合补 Web 端 AI 测试里的上传、流式渲染、前端回归 |
| appium/appium | 移动端自动化 | 跨平台移动测试、元素定位、手势、设备控制 | 适合和你的移动端专项一起学,重点理解自动化边界和不稳定点 |
| grafana/k6 | 接口性能、AI 接口压测 | 脚本化压测、指标采集、结果输出 | 如果团队已经有性能测试需求,它是很适合落地演示的工具 |
| locustio/locust | Python 风格性能测试 | 用 Python 写负载逻辑、用户行为编排 | 对已经学过 Python 的同学更友好,适合和课程性能篇配合练手 |
多端这组资源怎么用最稳。
先学你的课程页,把测试对象、场景和风险点理顺;然后只选一个自动化工具仓库去补。比如学 Web 就看 Playwright,学移动端就看 Appium,别同时把四五个框架都打开。
08. 一份不容易乱的补充节奏
| 你当前学到哪 | 建议补哪个 | 为什么这样配 |
|---|---|---|
| 学完 Python 与 AI API 实操 | openai-python + openai-cookbook | 一个看官方 SDK 姿势,一个看真实示例,够用了 |
| 学完 AI 功能测试 / Prompt | openai/evals 或 promptfoo | 开始建立自动评测和回归意识 |
| 学完 RAG 专项 | ragas | 把 RAG 评测指标从概念变成工具认知 |
| 学完 LangChain / LangGraph | langchain + langgraph | 回到官方仓库看最小 demo,理解框架真实结构 |
| 学完 Transformer 与训练原理 | huggingface/course + transformers | 一个补教学,一个补工程入口 |
| 学 Web / 移动端 / 性能专项 | playwright / appium / k6 | 按对象选工具,不要混着补 |
最后一句建议。
真正能让大家学到很多的,不是资源越多越好,而是每个阶段都知道"我现在该补什么,不该补什么"。所以我这次没有堆一堆所谓的 awesome 列表,而是尽量按你的课程顺序,只留那些最能接得上的仓库。
09. 偏见与公平性测试(对应第46篇)
这一组聚焦"模型在性别 / 种族 / 地域 / 职业等维度是否存在系统性偏差"。看仓库时不要陷在指标公式里,先用它给的题库跑一遍,再去看怎么定义"歧视"。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| nyu-mll/BBQ | 偏见基准 · 学术 | 问答式偏见数据集(9 个社会维度)、模板生成思路 | 当作"偏见测试集长什么样"的样板,先理解题型再谈指标 |
| huggingface/evaluate | 评测库 · 高 star | 内置的 fairness、toxicity、honest 等指标实现 | 不需要自己造轮子,先翻 measurements 目录看有没有现成指标 |
| google-research/google-research | 研究合集 · 子目录 | 子目录 tree/master/bias-bench :内在偏见基准对比 | 整个仓库非常大,只看 bias-bench 子目录即可 |
| openai/evals | 评测框架 · 官方 | evals/registry/data 下的 bias / fairness 类用例 | 把它和 BBQ 配合看:BBQ 提供数据,evals 提供运行框架 |
| Trusted-AI/AIF360 | 公平性工具包 · IBM 出品 | 群体公平性指标、缓解算法、偏见检测流程 | 原 IBM/AIF360 已迁移到 Trusted-AI 组织;适合补"公平性指标体系" |
| jaketae/word2bias | 词向量偏见 · 教学 | 词嵌入维度的性别 / 职业偏见可视化 | 体量小但思路清晰,适合在课程里做 5 分钟现场演示 |
10. LLM Benchmark 实操与污染防控(对应第47篇)
"刷榜"和"测试"不是同一件事。这组仓库帮你把基准测试做成"可复现 + 不被训练污染"的工程动作。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| EleutherAI/lm-evaluation-harness | 评测框架 · 高 star | 任务定义、prompt 模板、批量跑分、复现脚本 | 当今英文榜的事实标准,先跑一个 task 再读源码 |
| open-compass/opencompass | 中文评测 · 高 star | 中英双语任务、自定义模型接入、报告生成 | 国内团队首选;和 lm-eval-harness 二选一即可,不要都装 |
| mlcommons/inference | 性能基准 · 工业 | MLPerf Inference 的负载、SUT 设计、合规性脚本 | 聚焦"吞吐 / 延迟"基准,而不是"准确率"基准 |
| princeton-nlp/SWE-bench | 代码 Agent 基准 · 学术 | 真实 GitHub issue 修复任务、Verified 子集、评测沙箱 | SWE-bench 官方实现位于 princeton-nlp 组织;想做代码 Agent 必看 |
| lmarena/arena-hard-auto | 对战式评测 · 主流 | 500 道高区分度难题、GPT-4 作为 judge 的偏差校正 | 仓库实际名为 arena-hard-auto;适合补"对战式评测怎么避免裁判偏好" |
| simple-bench/SimpleBench | 反污染基准 · 新 | 对人类简单 / 对模型困难的题型设计、防泄漏策略 | 题量小但思路独特,配合 lm-eval-harness 一起跑 |
11. 数据隐私与 PII 泄露测试(对应第48篇)
这组重点不是"能不能识别 PII",而是"模型会不会把训练数据吐出来 / 训练流程能不能给出隐私保证"。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| microsoft/presidio | PII 识别 · 工业 | PII 识别器、匿名化、自定义实体扩展 | 做"上线前 PII 扫描"的事实选择,先看 quickstart |
| privacytrustlab/ml_privacy_meter | 隐私审计 · 学术 | 成员推断攻击 (MIA) 的标准实现、攻击 / 防御对照 | 用来回答"训练数据是不是被记下来了"这个问题 |
| ftramer/LM_Memorization | 提取攻击 · 经典论文 | 训练数据提取攻击的最小实现、复现脚本 | 论文配套代码,看完能理解"为什么大模型会逐字吐训练数据" |
| OpenMined/PySyft | 联邦 / 隐私计算 · 高 star | 差分隐私、联邦学习、隐私计算工程化 | 替代"jagielski/auditing-dpsgd"该仓库较冷门;这个更主流 |
| pytorch/opacus | 差分隐私训练 · PyTorch 官方 | DP-SGD、隐私预算(ε, δ)追踪、Hooks 实现 | 想验证"我们说的差分隐私真的有效吗",从 opacus 入手 |
| tensorflow/privacy | 差分隐私训练 · TF 官方 | DP 优化器、成员推断测试套件 | 有 TF 栈选这个,PyTorch 栈选 opacus,不用都看 |
12. 量化与推理引擎差异性测试(对应第49篇)
同一个模型权重,跑在不同推理引擎 / 不同量化精度上,输出可能完全不同。这组帮你建立"差异性回归"的工程意识。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| vllm-project/vllm | 推理引擎 · 高 star | PagedAttention、连续批处理、AWQ / GPTQ 集成 | 线上吞吐基线选这个;测试时关注采样参数对一致性的影响 |
| sgl-project/sglang | 推理引擎 · 新兴 | RadixAttention、结构化输出、多模态后端 | 和 vLLM 做 A/B 对比,能看出推理引擎对输出稳定性的影响 |
| NVIDIA/TensorRT-LLM | 推理引擎 · NVIDIA 官方 | FP8 / INT4 量化、TRT 引擎构建、Triton 部署 | N 卡生产环境必须了解的引擎,先看 examples |
| huggingface/text-generation-inference | 推理服务 · HF 官方 | Rust 服务端、量化适配、Watermark / Guidance | 注意 license 是 HFOIL,不能商用部署,但学习无障碍 |
| ollama/ollama | 本地推理 · 现象级 | 一行命令拉模型、Modelfile、OpenAI 兼容 API | 做"端到端 demo"和教学最方便的本地推理工具 |
| ggml-org/llama.cpp | CPU / GGUF · 现象级 | GGUF 格式、Q4_K_M 等量化方案、benchmark 脚本 | 原 ggerganov/llama.cpp 已迁移到 ggml-org 组织;GGUF 量化的事实标准 |
| ml-explore/mlx | Apple Silicon · 官方 | 统一内存、Lazy 计算、转换工具 | 苹果生态做端侧测试的首选框架 |
| InternLM/lmdeploy | 推理 / 量化 · 国产 | TurboMind 后端、W4A16 量化、KV Cache 量化 | 国产模型部署常用栈,和 vLLM 是另一种思路 |
| AutoGPTQ/AutoGPTQ | 量化算法 · 主流 | GPTQ 算法实现、校准数据集、量化后评测脚本 | 用来生成 GPTQ 量化权重;测试时配合 wikitext 跑 PPL |
| casper-hansen/AutoAWQ | 量化算法 · 主流 | AWQ 算法、4-bit 权重、与 vLLM / TGI 兼容 | 和 GPTQ 做对照,体会"量化方法不同 → 输出风格不同" |
13. Embedding 与向量库工程化评测(对应第50篇)
这组覆盖"embedding 模型怎么选"和"向量库怎么压"两条线。看仓库时分清楚:MTEB 是评测,FlagEmbedding 是模型,剩下是基础设施。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| embeddings-benchmark/mteb | Embedding 评测 · 标准 | 56 个数据集、8 类任务、自定义模型接入 | 选 embedding 模型时一定要先看 MTEB 排行榜 |
| FlagOpen/FlagEmbedding | Embedding 模型 · 国产 | BGE 系列、reranker、长文本嵌入 | 中文项目首选;还提供 finetune 脚本,可做"垂直领域微调" |
| milvus-io/milvus | 向量库 · 高 star | 分布式架构、HNSW / DiskANN、性能调优 | 大规模生产场景必看;测试关注 recall / QPS / 内存权衡 |
| qdrant/qdrant | 向量库 · Rust | 过滤式向量搜索、payload 索引、量化压缩 | 云原生场景部署轻便;适合做小到中规模的向量服务 |
| weaviate/weaviate | 向量库 · GraphQL | 多模态、混合搜索(向量 + 关键字)、模块化 | 带 schema 概念,适合需要结构化数据 + 向量的场景 |
| pgvector/pgvector | 向量扩展 · Postgres | HNSW / IVFFlat 索引、SQL 内嵌、ACID | 已有 PG 栈的团队首选;不用引入新数据库 |
| chroma-core/chroma | 向量库 · 入门友好 | Python in-process、嵌入函数封装、collection 概念 | 原型 / 教学最方便;不要拿它跑生产级负载 |
14. 模型升级与微调回归测试(对应第51篇)
当你换模型版本、做完一次 LoRA、调完一版 prompt,到底"变好了"还是"暗中坏了"?这组工具就是回答这个问题的。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| huggingface/peft | 参数高效微调 · HF 官方 | LoRA / QLoRA / IA³ / Prefix Tuning 实现 | 微调入口,看 examples 即可;回归测试要在微调前后两套权重上跑 |
| huggingface/trl | 对齐训练 · HF 官方 | SFT、DPO、PPO、GRPO trainer | 偏好优化后特别容易出回归,做完一次 DPO 必跑安全测试 |
| mlflow/mlflow | 实验管理 · 高 star | experiment、run、artifact、model registry | 做版本对比的基础设施;不用 MLflow 也要有等价的方案 |
| langchain-ai/langsmith-sdk | 评测 / 追踪 · LangChain | dataset、experiment、evaluator 三件套 | 原 langsmith-sdk-python 已合并入 langsmith-sdk 多语言仓库 |
| promptfoo/promptfoo | Prompt 评测 · 高 star | YAML 用例、CI 集成、新旧模型 diff 报告 | "换模型版本"这件事最直接的回归工具,配 GitHub Actions 用 |
| BerriAI/litellm | 统一 SDK · 高 star | 100+ 模型一致接口、callback、cost tracking | 做"同一套用例跑多个模型"对照实验时极其方便 |
15. 测试数据合成与用例自动生成(对应第52篇)
"没有数据怎么办"基本上是大模型测试的第一难题。这组工具帮你用 LLM 反向造数据。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| argilla-io/distilabel | 合成数据 · 主流 | Pipeline、LLM 蒸馏、preference 数据生成 | 做 SFT / DPO 数据准备时几乎是首选 |
| argilla-io/argilla | 数据标注平台 | UI、人审流程、与 distilabel 联动 | 合成完后必须有人审一轮,argilla 就是这一轮的工具 |
| yizhongw/self-instruct | 自指导生成 · 经典 | 种子任务 → 扩展 → 过滤 的三步法 | 看思路而不是看代码,2026 年实操工具更成熟 |
| nlpxucan/WizardLM | 难度演化 · 经典 | Evol-Instruct:把简单问题"演化"成复杂问题 | 用来生成"难样本"覆盖测试盲点,思想很重要 |
| confident-ai/deepeval | LLM 单元测试 · 高 star | 14+ 评测指标、pytest 集成、合成数据器 | 把 LLM 评测做成"像跑 pytest 一样",强烈推荐先试 |
| microsoft/promptbench | 对抗扰动 · 学术 | 字符 / 词 / 句子级扰动、鲁棒性评测 | 用来测"prompt 加点错别字模型还能不能扛住" |
16. 2026 Agent 协议测试(对应第53篇)
2025-2026 进入"Agent 协议年":MCP(工具)、A2A(智能体之间)、各家自家 Agents 框架并行。这组帮你看清协议层。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| anthropics/anthropic-cookbook | Claude 官方示例 | tool use、computer use、MCP 接入示例 | 组织名实际是 anthropics 不是 anthropic;2026 看 Claude Agent 必看 |
| openai/openai-python | OpenAI 官方 SDK | Responses API、Agents SDK、Tools | 2026 主推 Responses API,老的 Chat Completions 仍可用但建议迁移 |
| a2aproject/A2A | Agent 间协议 · Google 主推 | Agent Card、Task、Message 协议规范 | Google 已把 A2A 移交 Linux Foundation,仓库现位于 a2aproject |
| langchain-ai/langgraph | Agent 框架 · 高 star | StateGraph、checkpoint、人在环 (HITL) | 测试 Agent 流程的中断 / 恢复 / 回滚必看 |
| microsoft/autogen | 多智能体 · 高 star | 对话式编排、GroupChat、AutoGen Studio | 研究多智能体协作模式时第一个看的仓库 |
| ag2ai/ag2 | AutoGen 社区分叉 | 从 microsoft/autogen 分叉,社区主导,更新更快 | 有些功能 autogen 还没有,ag2 已经做了,可作为对照 |
| modelcontextprotocol/python-sdk | MCP SDK · 官方 | Server / Client、Resource / Tool / Prompt 三类原语 | 2026 工具调用的事实标准,Anthropic + OpenAI 都已支持 |
17. 实时语音视频流测试(对应第54篇)
实时多模态的测试和文本测试完全不是一回事。这组覆盖端到端语音、VAD、ASR / TTS 三块。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| openai/openai-realtime-api-beta | 实时 API · 官方参考 | WebSocket 协议、音频帧编码、打断 / VAD | 看协议时序图;测试关注首字延迟和打断及时性 |
| google-gemini/cookbook | Gemini 官方示例 | Live API、视频流输入、多模态对照 | 和 OpenAI Realtime 做协议对比,理解两家的设计取舍 |
| snakers4/silero-vad | VAD · 主流 | 语音活性检测、低延迟、多语言 | 实时语音绕不开 VAD,先用它做端点检测 |
| speechbrain/speechbrain | 语音工具箱 · 学术 | ASR / Diarization / 增强 / 说话人识别 | 需要"自己拼语音流水线"时再用,平时用 API 即可 |
| m-bain/whisperX | ASR · Whisper 增强 | 词级时间戳、speaker diarization、批量加速 | 做语音转写质量评测时的事实标准 |
| coqui-ai/TTS | TTS · 经典 | 多说话人、声音克隆、XTTS v2 | 原公司虽已关停,仓库仍是开源 TTS 教学首选 |
| livekit/agents | 实时 Agent 框架 | WebRTC 接入、turn detection、多模态 worker | 2026 做"语音 Agent"产品最完整的开源框架 |
18. AI 应用合规与备案测试(对应第55篇)
这组对应"上线前合规检查清单"——既要能挡住违法违规输出,也要能在备案 / 审计中拿出证据。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| meta-llama/PurpleLlama | 安全工具集 · Meta 官方 | Llama Guard、CyberSec Eval、Code Shield | 看 Llama Guard 怎么定义 13 类违规;可直接复用其分类法 |
| guardrails-ai/guardrails | 输出守卫 · 高 star | RAIL spec、validators、re-ask 机制 | 做"输出格式 + 内容双重护栏"很顺手 |
| NVIDIA/NeMo-Guardrails | 对话护栏 · NVIDIA | Colang 语言、topic / safety / fact rails | 对话型应用的多轮护栏首选;学习曲线略陡 |
| mlcommons/modelbench | AILuminate 基准 · 行业 | 12 类危害评测、A-E 等级评分 | AILuminate 的运行器实际位于 mlcommons/modelbench 仓库 |
| thu-coai/SafetyBench | 中文安全基准 · 学术 | 7 类安全维度、中英双语题库 | 替代原"explosion/safetybench"(不存在);国内合规测试必备 |
| tatsu-lab/alpaca_eval | 自动评测 · 学术 | LLM-as-judge、长度偏差矫正、leaderboard | 需要"自动出报告"时的轻量方案,配合人审一起用 |
19. 端侧 AI 与小模型测试(对应第56篇)
2026 端侧推理已经从"玩具"变成"刚需"。这组覆盖 Apple / Web / 移动 / 跨平台四条路径。
| 资源 | 类型 Tag | 重点看什么 | 使用建议 |
|---|---|---|---|
| ml-explore/mlx-lm | Apple 端侧 LLM · 官方 | mlx_lm.generate / server、量化、LoRA | 从 mlx-examples 拆出来的独立仓库,Mac 上跑 LLM 最简洁 |
| ggml-org/llama.cpp | 跨平台端侧 · 现象级 | GGUF、Metal / CUDA / Vulkan 后端、benchmark | 端侧测试的"瑞士军刀",移动 / 桌面 / 嵌入式都能跑 |
| mlc-ai/mlc-llm | 编译式部署 · 高 star | TVM 编译、iOS / Android / WebGPU 全打包 | 想真正发到 App Store / Play 上跑,看这个 |
| microsoft/onnxruntime | 跨平台推理 · 高 star | ONNX 模型转换、QDQ 量化、ORT-GenAI | 企业级跨平台部署的稳定方案 |
| huggingface/transformers.js | 浏览器内推理 · HF 官方 | WebGPU / WASM 后端、Pipeline API、模型转换 | 纯前端跑模型最直接的方案;做 H5 demo 极合适 |
| apple/coremltools | Core ML 转换 · Apple 官方 | PyTorch / TF → Core ML、ANE 优化、量化 | iOS 应用要走 ANE,必经 coremltools 这一步 |
| google-ai-edge/mediapipe | 端侧多模态 · Google 官方 | LLM Inference API、视觉 / 音频任务、跨平台 | Google 端侧 AI 入口已合并到 google-ai-edge 组织 |
补充练习与参考答案
补充练习
- 假设你刚学完 Python 与 AI API 实操,列出你会优先看的 2 个仓库,并说明理由。
- 如果你当前目标是补 RAG 评测能力,你会怎样安排一周的练习顺序?
- 为什么"资源越多越好"对初学者反而可能是坏事?
参考答案要点
- 实操阶段优先官方 SDK 和 cookbook,目标是先跑通、先看懂,而不是一开始就陷入复杂框架。
- RAG 学习顺序通常应是:先理解检索评测指标,再看最小 demo,最后自己做一组 query-doc 的回归测试。
- 资源过多会让人不断切换上下文,最有效的方法是每个阶段只选最接得上的 1 到 2 个仓库。
返回课程首页 回到主线开始学习 →
GitHub 补充学习资源 大模型测试体系教程 · 配套学习导航