ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AI工程从零开始:课程内容API参考与GitHub Raw内容源抓取指南(附完整路径清单)

2026/9/17 3:51:44 拓冰建站 浏览量
AI工程从零开始:课程内容API参考与GitHub Raw内容源抓取指南(附完整路径清单) AI工程从零开始课程内容API参考与GitHub Raw内容源抓取指南附完整路径清单【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratchAI Engineering from Scratchai-engineering-from-scratch是一门从数学基础到生产级AI系统的完整免费课程。本文介绍它的课程内容API与GitHub Raw内容源如何通过 API 端点、Raw 直链和 llms.txt 索引用最少请求抓取全部课程 Markdown 源码并给出本地 clone 与缓存配置的实操步骤适合想做内容聚合、AI Agent 接入或站点镜像的新手读者。内容从哪里来三层数据源想抓课程数据先搞清楚项目的三层数据架构见 site/content-source.js层级内容源获取方式 网站 APIllms.txt、/lesson、/sitemap.xml普通 HTTP GET Raw 仓库源课程 Markdown、代码、测验 JSONGitHub Raw 直链 本地克隆全量课程文件git clone核心逻辑在 site/content-source.js#L26-L40线上环境通过rawRepoUrl()拼接Raw 地址raw.githubusercontent.com/作者/仓库/分支/文件路径直接读取仓库文件本地预览则退化为相对路径../。这意味着课程内容以仓库文件为唯一权威源网站只是渲染层。课程内容API端点一览官方 OpenAPI 规范见 site/openapi.json完整路由配置在 vercel.json。四个关键端点 1. llms.txt —— Agent 课程总索引首选入口返回整门课程的 Markdown 索引专为 AI Agent 设计是批量抓课的最佳起点curl -H Accept: text/markdown https://aiengineeringfromscratch.com/llms.txtMarkdown 内容类型由 vercel.json#L76-L82 的响应头保证并带 5 分钟缓存 7 天 CDN 缓存抓取无需担心限流。 2. /lesson —— 单课页面/lesson?pathphases/01-math-foundations/01-linear-algebra-intuitionpath必须是仓库内相对路径格式受正则约束phases/阶段/课程或certifications/claude/lessons/课程校验逻辑见 api/lesson.js#L97-L100参数不合法返回 404非法查询参数会触发308 永久重定向到规范化 URL页面内嵌schema.org/LearningResource结构化数据利于二次索引 3. /sitemap.xml 与 /certification?ID/sitemap.xml所有可公开访问的规范化 URL适合生成全站抓取队列/certification?idclaude-ccao-f认证赛道页面课程清单可参考 certifications/claude/program.json 4. 页面级 Markdown 协商/catalog、/glossary、/about等页面支持内容协商请求头带Accept: text/markdown即返回纯 Markdown 而非 HTML。实现见 api/markdown.js#L45-L83路由映射在 vercel.json#L13-L22。GitHub Raw 内容源直接抓取课程文件Raw 地址拼接规则课程文件可直接按仓库/路径用 Raw 方式读取无需登录、无需鉴权。示例# 抓取某课的英文文档 curl RAW域名/ai-engineering-from-scratch/main/phases/01-math-foundations/01-linear-algebra-intuition/docs/en.md # 抓取课程元数据含标题、学习目标、测验 curl RAW域名/ai-engineering-from-scratch/main/phases/03-deep-learning-core/03-backpropagation/lesson.json⚠️ 注意 site/content-source.js#L16-L24 的clean()函数会剔除..段——抓取脚本应做同样的路径净化防止目录穿越。课程目录结构速查想抓什么路径模板课程正文phases/00~19-*/课程编号/docs/en.md课程元数据phases/…/lesson.json可运行示例phases/…/code/Python / Jupyter认证课程certifications/claude/lessons/学习路径learning-paths/10 条 JSON 路径阶段说明各phases/NN-*/README.md三种抓取方式怎么选1️⃣ 浏览器端动态抓取官网页面本身就是从 Raw 源加载内容的复用 site/content-source.js 暴露的AIFSContentSource.repoUrl()即可拿到合法 Raw 地址__AIFS_SOURCE/__AIFS_REF决定仓库与分支。2️⃣ 脚本批量抓取推荐「先拉llms.txt建索引 → 按path逐课拉 Raw 文件」两步走幂等且可断点续传。3️⃣ 离线镜像直接克隆仓库课程即文件天然 Git 友好git clone https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch缓存策略与限流建议 ️抓取前先看 vercel.json#L35-L83 的缓存声明照做即可对上游友好HTML 页面max-age3005 分钟 CDN 一天本地缓存≥5 分钟llms.txt / Raw 课程文件max-age300stale 可延长 7 天静态资源css/js/pngmax-age86400可缓存 7 天Raw 请求自带Git 版本分支main拉全量前建议先确认目标分支名常见坑path含大写或..会 404lesson.html旧链接会 308 跳转到/lesson见 site/openapi.json#L190-L219务必跟随重定向并把跳转后的 URL 作为抓取规范地址。小结 批量入口/llms.txtMarkdown 索引/sitemap.xml 单课/lesson?path…或 Raw 直连仓库文件 尊重Cache-Control缓存 5 分钟起步官方接口契约以 site/openapi.json 为准路由映射见 vercel.json掌握以上内容源与 API 参考你就能零依赖地把整门 AI 工程课程接入自己的 Agent、镜像站或学习工具中。【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考