Easy Data x AI 课程共建:补上 Agent 时代的数据基础课

社区课程《Easy Data x AI》共建活动启动了!

从大模型到 Agent,从数据底座到应用实践,我们希望能够和更多共建者一起把这门课做出来。

现在这门课程缺少的就是你的真实经验,欢迎大家一起来添上几笔~

最近和大家聊 AI Agent,总会绕回几个老问题:记忆系统是产品概念还是能落地的工程方案?Skill、MCP、上下文工程听着都熟,真要做一个能长期跑的 Agent,第一步从哪下手?

Easy Data x AI 开源课程共建主题图

很多教程把答案讲得很漂亮,学习者真正卡住的却是工程选择:架构图好看,动手时却不知道该用向量、关键词还是混合检索;Agent 看上去会“记住”,但记什么、忘什么、冲突了怎么办,往往没有标准答案。

Agent 工程落地中常见卡点示意

为此我们做了还在内测的开源课程《Easy Data x AI》。它不是又一份“从零学大模型”的资料,而是想把 Data 与 AI 之间最容易踩坑的那段路讲清楚。课程由 Datawhale 与 OceanBase 社区联合共建,已有基础篇、产品向的「道篇」和开发者向的「术篇」。现在更希望社区一起把它写深、写准、写实用。

这门课想解决什么问题?

现在会调 LLM API 的人越来越多,但能把 Agent 做成一个稳定系统的人,还是稀缺。

原因也简单:Agent 不是一个 prompt 加几个 tool call。它需要数据层,需要检索,需要记忆,需要任务拆解,需要上下文管理,还需要一套能判断效果的评估方法。LangChain 的 Deep Agents 文档[2]里也把这些能力拆得很细:任务规划、文件系统、子 Agent、长期记忆、Human-in-the-loop、Skill,以及 MCP 工具接入。

《Easy Data x AI》选择从两条线讲这件事。

一条是“道篇”,更适合产品同学、运营同学、业务负责人和零基础 AI 爱好者。它不要求你上来就写代码,而是先帮你判断:这个需求适不适合做 Agent?RAG 应该怎么设计才不只是“塞进向量库”?记忆系统到底应该给用户带来什么体验?

另一条是“术篇”,面向已经能写点代码、能调用 LLM API 的开发者。这里会动手做 Streaming、Tool Use、AI Native 数据层、Agentic RAG、记忆系统和 Skill 到 MCP 的综合实战。

道篇与术篇双线课程结构示意

一个讲判断力,一个讲动手能力。两条线都需要,因为只会讲概念,最后容易做成 PPT;只会堆代码,又很容易做成一个没人想用的 demo。

为什么需要共建?

因为 Agent 这块变化太快,靠几个人闭门写课,很容易慢半拍。

比如混合检索。Meilisearch 在一篇介绍 hybrid search RAG[3] 的文章里提到,混合检索会同时用关键词搜索和语义搜索,再把更相关的结果送给大模型。这个说法不复杂,但真正落地时,权重怎么调、延迟怎么控、评测怎么做,都不是一句“用混合检索”能解决的。

再比如 AI Native 数据库。seekdb 官网把自己定义为一个把关系、向量、文本、JSON、GIS 放进同一个引擎的 AI-native search database;OceanBase 的文章《From Complex to Simple: How We Built seekdb for the AI Era[4]》也提到,AI 应用常见的问题不是没有工具,而是工具太碎,数据、索引、检索、重排之间有太多胶水代码。

课程共建覆盖混合检索与记忆等主题

这些变化,正好对应《Easy Data x AI》里想补的内容:混合检索、Agentic RAG、长期记忆、Skill 标准化、多租户记忆隔离、MCP 实战、评测和成本收益分析。

所以这门课现在最需要的,不是围观,而是有人来把自己踩过的坑写进去。

如何参与共建?

我们已经在贡献指南里列了一批适合大家认领的共建任务,并为这些共建任务设置了不同的难度等级(L1 ~ L3)。

如果你第一次参与开源共建,可以从简单难度的任务(Good First Issue)L1 开始,把共建流程走通,比如补充 Skill 设计规范、修正文档衔接、完善章节引入。

如果你上手做过和课程内容有关的实验,可以选择中等难度的任务 L2,比如补充记忆衰减策略、Embedding 模型选型、混合检索的延迟和成本对比。这类内容很适合把真实测试过程写成课程材料。

如果你有工程经验,可以直接挑战难度更高的任务 L3,比如:多 Agent 记忆冲突的工程化解决、多 Skill 给上下文工程带来爆上下文的解决思路、混合检索上手实战……这些任务做完,不只是给课程添一节内容,也会变成你自己可以拿出来展示的开源作品。

按 L1 到 L3 认领共建任务流程

贡献方式也很简单:看一眼 课程共建指南[5],找到你感兴趣的 Issue,留言认领,写完提 PR。哪怕只是修一个事实错误,也算贡献;如果你独立完成扩展篇,还会有正式署名。

课程共建者的激励与收获

我们希望每一位参与者不仅留下贡献,也能收获成长。所有被合并 PR 的贡献者都会获得以下激励:

🏆 贡献者墙

所有合并过 PR 的贡献者,会自动登上课程仓库 README 的贡献者墙(头像 + GitHub 主页 + 贡献量),由 GitHub Action 自动更新,无需手动申请。

🎁 实体礼品

按贡献量分档赠送 OceanBase 社区定制周边

档位

条件(示例)

礼品

入门

合并 1 个有效的 PR

OceanBase 定制贴纸 / 定制徽章

进阶

合并 2 个及以上的内容完善类 PR

OceanBase 专属马克杯 / 专属帆布包

核心

独立完成一节扩展篇内容

OceanBase 布道师礼品套装

🌟 成长与社区收获

  • 课程署名:扩展篇作者会在课程对应章节页面的正式署名。
  • 纳入 OceanBase 社区布道师体系:表现突出的共建者可被推荐为「种子布道师」,获得 OceanBase 官方证书。
  • 讲师 / 露出机会:受邀参与社区直播、线下 Meetup、高校行,输出自己的内容。
  • 优秀贡献者评选:定期评选季度优秀贡献者,额外礼品 + 社区公众号专访。
  • 职业机会:优秀贡献者可获得蚂蚁集团及 OceanBase 实习 / 内推推荐。
  • 联合社区礼品:根据课程共建的贡献量,还可获得 OceanBase 社区为大家准备的定制礼物,以及 LangChain 中国社区的礼品。

适合谁来参与共建?

如果你是学生,想找一个比“复现论文”更贴近真实工程的练手项目,这门课适合你。

如果你是开发者,已经会用 LangChain/LangGraph、LlamaIndex、向量库或数据库,但想把经验沉淀成别人也能看懂的教程,这门课也适合你。

如果你是产品或运营同学,平时经常要判断“这个需求能不能用 AI 做”,你也可以参与“道篇”的内容共建。因为很多 Agent 项目的失败,不是模型不够强,而是一开始就没想清楚场景、边界和评价标准。

还有一种人特别适合来:你刚好被某个问题折磨过。比如记忆冲突,比如上下文爆炸,比如 RAG 查不到该查的内容,比如 Tool Use 只能跑通 demo,一上真实环境就开始摇摆。只要你愿意把这个过程写下来,后面的人就能少走一段弯路。

最后,欢迎来写一小段

开源课程最有意思的地方,是它不会在发布那天就结束。

一门课能不能变好,靠的不是首页写得有多漂亮,而是有没有人愿意把真实经验塞进去:一个更清楚的图,一个更稳的示例,一段更准确的解释,一次踩坑后的修正。

《Easy Data x AI》现在还在 Alpha 内测阶段,正适合参与。你不需要等自己变成“专家”再来贡献。很多时候,刚学会的人最知道哪里难懂,刚踩过坑的人最知道哪里该补。

邀请社区共建者补充真实工程经验

如果你愿意,欢迎和我们一起来把这门课写完~

What’s more?

顺手再为大家安利一门进阶课。

这门课同样是开源课程,作者也是《Easy Data x AI》的维护者 —— LangChain 中国区唯一的社区大使张海立老师。

如果你已经不满足于“理解 Agent”,想直接上手做更完整的 Agent 系统,就可以来看看《Deep Agents 实战[6]》。

它更偏工程进阶,会围绕 Deep Agents 讲虚拟文件系统、任务规划、子 Agent、异步子 Agent、Skills、长期记忆等能力。LangChain 的 deepagents 仓库[7]也把它描述成一个带文件系统、子 Agent、上下文管理、Skills 等能力的 agent harness。

课程仓库与相关社区资源入口

所以大家可以把两门课连起来看:《Easy Data x AI》帮你补齐 Data 与 AI 的基础判断,《Deep Agents 实战》带你继续往生产级 Agent 的方向走。

最后的最后,我们把《Easy Data x AI》课程的共建链接放在了文末的“阅读原文”。欢迎大家挑个顺眼的任务,去 GitHub 上参与共建吧~

Datawhale 与 OceanBase 联合共建二维码

参考资料

[1]

Easy Data x AI: https://github.com/datawhalechina/easy-data-x-ai

[2]

Deep Agents 文档: https://docs.langchain.com/oss/python/deepagents/overview

[3]

hybrid search RAG: https://www.meilisearch.com/blog/hybrid-search-rag

[4]

From Complex to Simple: How We Built seekdb for the AI Era: https://en.oceanbase.com/blog/23848834048

[5]

课程共建指南: https://github.com/datawhalechina/easy-data-x-ai/blob/main/CONTRIBUTING.md

[6]

Deep Agents 实战: https://github.com/datawhalechina/deepagents-in-action

[7]

deepagents 仓库: https://github.com/langchain-ai/deepagents