Me:
2026年agent爆发,workbuddy为首的办公agent逐渐成熟。我已有的技术栈主要是python后端和langchain/langgraph,而且其实都不算专精。你认为我有必要学哪些新的东西和框架呢?
ChatGPT:
我认为你现在没有必要再把自己训练成“会十几个 Agent 框架的人”。相反,你最需要做的是一次技术栈升级:
从「Python 后端 + LangChain/LangGraph 使用者」
升级为「能够设计、集成、评估、部署 Agentic Workflow 的 AI 应用工程师/解决方案型人才」。
这其实非常符合你现在的工作状态。你已经从纯粹找 AI 应用开发实习,进入了一个大量使用成熟 Agent 产品、工作流和多模态工具的环境。未来真正值钱的能力,未必是“我会手写一个 Agent”,而是:
我知道一个 Agent 系统应该怎么拆、怎么接入工具、怎么协作、什么时候不应该用 Agent、怎么验证它真的能工作。
2026 年 Agent 工程已经明显进入生产化阶段。行业关注点正在从“谁能做出一个 Demo”转向可靠性、观测、评估和系统集成;一项 2026 年调研中,57% 的受访组织已经有 Agent 进入生产环境,而 observability 的普及率已经高于 evaluation。
一、先说结论:你的学习优先级
我会建议你按照下面的优先级补:
第一优先级:MCP + Agent 协议
必学:MCP
如果说 2024 年是 Prompt Engineering,2025 年是 Agent Framework,那么到了 2026 年,我认为 MCP 已经比再学一个 CrewAI 更值得你投入。
你需要真正掌握的不是:
“我会调用 MCP Server。”
而是:
-
MCP Server 是什么
-
Tool、Resource、Prompt 分别是什么
-
一个 Agent 如何发现和调用 MCP 工具
-
如何自己封装一个 MCP Server
-
如何把数据库/API/内部系统包装成 MCP 能力
-
MCP Server 的权限、安全边界如何设计
-
本地 MCP 和远程 MCP 有什么区别
未来很可能出现这种企业架构:
┌──────────────┐
│ AI Agent │
└──────┬───────┘
│
MCP
│
┌─────────────────┼──────────────────┐
│ │ │
CRM System Database Workflow
│ │ │
企业系统 数据服务 自动化能力
而你现在的 Python 后端能力,正好非常适合做这件事。
你完全可以把以前的:
FastAPI + API
逐渐升级为:
FastAPI + MCP Server + Agent Tool Layer
这是非常自然的技术演进。
第二优先级:A2A
MCP 解决的是:
Agent 怎么调用工具和数据?
A2A 解决的是:
Agent 怎么和另一个 Agent 通信?
A2A 的官方定义就是面向不同框架、不同厂商 Agent 之间的互操作;它与 MCP 并不是竞争关系,而是互补关系。(A2A Protocol)
未来系统可能变成:
用户
│
▼
总控 Agent
│
├──── A2A ───► 数据分析 Agent
│
├──── A2A ───► 内容生产 Agent
│
├──── A2A ───► 视频生成 Agent
│
└──── A2A ───► 发布运营 Agent
每个 Agent 内部又:
Agent
│
└── MCP
│
├── Database
├── Search
├── Python
└── 企业 API
这套结构其实非常值得你理解。
因为你现在所在的 AI 业务环境,本身就涉及:
-
多 Agent
-
工作流
-
内容生产
-
多模态
-
自动发布
-
不同平台的工具协作
你未来甚至未必需要亲自实现所有 Agent,但你应该能看懂:
这个系统到底应该 MCP 接工具,还是 A2A 调其他 Agent?
这是非常关键的架构能力。
二、LangGraph 不要放弃,但不要继续“只学 LangGraph API”
你的 LangGraph 基础其实应该继续保留。
因为从当前框架生态来看,LangGraph 仍然是复杂、状态化、需要精确控制的 Agent Workflow 中非常重要的一类方案。现在各框架已经开始明显分化,而不是简单地“谁替代谁”:LangGraph 偏显式状态和复杂编排,OpenAI Agents SDK 偏轻量 Agent delegation,LlamaIndex 更偏数据/文档驱动,Microsoft Agent Framework 则更偏企业 Microsoft 技术栈。(LangChain)
所以你下一步不要再花很多时间:
from langgraph.graph import StateGraph
然后继续背:
add_node()
add_edge()
add_conditional_edges()
这些 API 不重要。
你真正应该深入的是:
1. Agent 状态设计
比如:
State
├── User Intent
├── Current Task
├── Plan
├── Intermediate Result
├── Tool Result
├── Memory
├── Retry Count
└── Final Result
2. Human-in-the-loop
哪些操作:
AI 自动执行
哪些操作:
AI 提交 → 人审核 → 继续
例如:
AI 生成内容
↓
人工审核
↓
通过?
├── 是 → 自动发布
└── 否 → 返回修改
3. Long-running Agent
真正复杂的企业任务可能持续:
-
10 分钟
-
2 小时
-
一天
-
多天
所以你要理解:
-
Checkpoint
-
Resume
-
Retry
-
Interrupt
-
Durable Execution
-
Side Effect
这才是 LangGraph 比较核心的价值。
三、我建议你学一个“非 LangChain 系”框架,但只选一个
你现在已经有 LangChain/LangGraph 了,所以没必要把:
-
CrewAI
-
AutoGen
-
Google ADK
-
OpenAI Agents SDK
-
Pydantic AI
-
Microsoft Agent Framework
全部学一遍。
那样非常容易重新回到:
“我懂很多框架,但其实一个都没做深。”
我反而建议你选一个作为第二 Agent Framework。
我的首推:OpenAI Agents SDK
原因不是说它一定比 LangGraph 强。
而是它和你的 LangGraph 是两种思维。
LangGraph 是:
我要控制整个流程。
OpenAI Agents SDK 更接近:
我要定义 Agent、工具、Handoff 和 Guardrail。
它非常适合让你建立另一种 Agent 编程思维。
例如:
Main Agent
│
├── Research Agent
│
├── Writing Agent
│
└── Data Agent
通过 Agent delegation 来完成任务。
官方生态中,OpenAI Agents SDK 被定位为适合相对紧凑的 Assistant、多 Agent 委派和较少抽象层的 Agent 开发方式。(LangChain)
所以我建议:
LangGraph 深一点 + OpenAI Agents SDK 浅到中等深度
这样你的 Agent 技术视野会更完整。
四、你现在非常缺的,其实不是 Agent Framework,而是“Agent Engineering”
这是我最想强调的一点。
2024 年很多人的学习方式是:
LLM
↓
Prompt
↓
Agent
↓
Tool
↓
成功!
但真实生产环境是:
用户输入
↓
Input Validation
↓
Agent
↓
Tool Calling
↓
权限验证
↓
执行
↓
失败?
├── Retry
├── Fallback
├── Human Review
└── Error Handling
↓
Trace
↓
Evaluation
↓
Monitoring
你应该开始学习以下内容:
1. Observability
也就是:
为什么这个 Agent 做出了这个结果?
你应该能够追踪:
User Input
↓
Prompt
↓
Model Call #1
↓
Tool Call
↓
Tool Result
↓
Model Call #2
↓
Final Output
需要知道:
-
Trace
-
Span
-
Token
-
Latency
-
Cost
-
Tool Error
-
Failure Rate
具体产品不用全学,但至少理解:
-
LangSmith
-
Agent tracing
-
OpenTelemetry
行业已经非常明显地从“能跑”走向“能观察、能调试”。(LangChain)
2. Evaluation
这是我认为你比继续学 CrewAI 更应该补的东西。
比如你做一个 Agent:
用户提问 → Agent 调工具 → 输出结果
你怎么证明它好?
不能靠:
“我感觉挺不错。”
你需要开始理解:
测试集
Question
Expected Behavior
Expected Tool
Expected Output
例如:
问题:
帮我查一下昨天的销售额
期望:
1. Agent 调用 SQL Tool
2. 查询昨天的数据
3. 不应该调用 Web Search
4. 输出数值
然后进行:
-
Tool Selection Eval
-
Answer Quality Eval
-
Hallucination Eval
-
Regression Test
以后你会发现:
Agent 产品真正难的不是“做出来”,而是“改了 Prompt 后,原来的 200 个场景会不会崩”。
这个能力特别适合你。
因为你以前就意识到自己需要补:
测试、验证脚本。
实际上这和 Agent Evaluation 是可以直接结合的。
五、Python 方面我建议补“工程能力”,而不是再学新语法
你的 Python 已经够用了。
接下来应该把 Python 从:
“写脚本的语言”
升级成:
“AI Agent 系统的工程语言”
重点学:
FastAPI + Pydantic
尤其是:
Structured Output
Schema Validation
API Contract
Agent Input / Output
例如:
class ContentPlan(BaseModel):
title: str
platform: str
publish_time: datetime
tags: list[str]
然后 Agent 输出:
{
"title": "...",
"platform": "小红书",
"publish_time": "...",
"tags": ["AI", "Agent"]
}
这比:
一大段自然语言
更适合进入下游系统。
异步编程
建议你补:
-
async -
await -
asyncio
-
并发 API 调用
-
Streaming
因为 Agent 系统天然会出现:
Agent
├── LLM Call
├── Tool A
├── Tool B
└── Tool C
你以后一定会遇到:
为什么这个 Agent 这么慢?
答案很多时候不是模型慢,而是:
所有工具串行执行
六、数据库要补,而且优先级其实很高
你之前 SQLite + SQLAlchemy 基础有了。
建议升级到:
PostgreSQL
重点不是数据库八股,而是:
SQL
Index
Transaction
JSONB
Full-text Search
pgvector
未来企业 Agent 的 Memory、Session、User Data、Task State、Trace Metadata,很多最终都要落数据库。
你未来可能面对:
Agent Runtime
│
├── Redis
│
├── PostgreSQL
│
├── Object Storage
│
└── Vector DB
所以我会建议你:
不要继续折腾很多新的向量数据库
你以前已经用过 ChromaDB。
下一步直接:
PostgreSQL + pgvector
理解:
-
关系型数据
-
结构化 Agent State
-
向量检索
-
用户数据
怎么放在一个更完整的系统里。
七、你应该开始学“Workflow Automation”,而不是只盯着 Agent
这是结合你现在工作场景,我认为最重要的建议。
很多人把未来理解成:
Agent 会取代 Workflow。
我反而认为:
Agent + Workflow 会融合。
例如:
用户需求
↓
Agent 理解需求
↓
生成内容方案
↓
Workflow 执行
├── 调用图片模型
├── 调用视频模型
├── 保存文件
├── 发布平台
└── 通知用户
Agent 负责:
思考、规划、判断
Workflow 负责:
稳定、重复、确定性执行
所以你应该理解:
-
n8n
-
Dify Workflow
-
Coze Workflow
-
企业办公自动化
尤其是:
Webhook
API
Trigger
Queue
Scheduler
Human Approval
这对你现在的实际工作可能比学一个新的 Python Agent Framework 更有价值。
八、多模态应该开始学,但不是去训练模型
你现在所在的 AI 业务环境明显已经不是单纯:
Chatbot
而是:
Text
+
Image
+
Video
+
Audio
+
Digital Human
所以你需要理解多模态 Agent 的 Pipeline:
文本需求
↓
LLM 生成脚本
↓
Image / Video Model
↓
TTS
↓
数字人
↓
剪辑
↓
审核
↓
发布
重点不是:
我要研究 Diffusion Transformer。
而是:
我能不能把多个多模态能力组合成一个可交付的生产系统?
建议补:
-
图像/视频模型 API 调用
-
多模态 Prompt
-
File Pipeline
-
Object Storage
-
视频/音频基础处理
-
FFmpeg
尤其是 FFmpeg,我甚至觉得你可以学一点。
因为只要开始做:
-
视频自动化
-
AI 视频工作流
-
多媒体内容 Pipeline
它经常会出现。
九、如果是我给你重新规划技术栈
我会给你这样分层:
AI Product / Solution
▲
│
Agent System Design
▲
│
┌──────────────┴──────────────┐
│ │
Agent Engineering Workflow Engineering
│ │
│ ├── n8n / Coze
│ ├── API / Webhook
│ └── Automation
│
├── LangGraph
├── OpenAI Agents SDK
├── MCP
├── A2A
├── Memory
├── Evaluation
└── Observability
▲
│
Backend Foundation
│
┌──────────────┼──────────────┐
│ │ │
Python FastAPI PostgreSQL
Async Pydantic Redis
API Streaming SQL
然后外面再接:
┌─────────────┐
│ Multimodal │
└──────┬──────┘
│
Image / Video / Audio
│
▼
Agent System
│
▼
Workflow / Automation
│
▼
Business
十、具体来说,我会让你未来半年重点补这 6 个东西
按优先级:
① MCP
必须深入。
不是会配,而是自己写。
② Agent Evaluation + Observability
这是你从“Agent 玩家”升级成“Agent 工程师”的关键。
③ Workflow Automation
尤其结合你现在的 Coze、办公 Agent、内容生产环境。
④ PostgreSQL + Redis
补齐 Agent 后端基础设施。
⑤ OpenAI Agents SDK
作为第二 Agent Framework。
⑥ A2A
先理解协议和架构,不需要一开始钻得特别深。
至于这些,我建议暂时不要作为主线
CrewAI
可以了解,但没必要专门投入。
AutoGen
了解历史和思想即可,除非进入微软生态。
微调
不是你当前最优先的方向。
自己训练模型
更不是。
一次性学十几个 Agent Framework
完全没有必要。
最后,我对你现在的判断是
你其实已经不太适合继续按照:
Python → LangChain → RAG → LangGraph → 再学 CrewAI → 再学 AutoGen
这种“框架升级路线”学习了。
因为你的职业轨迹已经发生变化。
你现在更应该走:
Backend Engineer
→ AI Application Engineer
→ Agent / Workflow Engineer
→ AI Solution Architect / AI Product + Technical Hybrid
而且你现在这个工作环境,反而可能让你获得很多纯开发实习生接触不到的东西:企业实际到底怎样使用 Agent,业务流程哪里值得自动化,什么东西用户真的愿意为之付费。
从长期来看,这可能比再熟练一个 Agent Framework 更有价值。
如果让我直接给你制定下一阶段的学习路线,我甚至不会做成传统的“每天学 LangGraph API”模式,而会给你设计成一条:
MCP → Agent 工程化 → Workflow Automation → 多模态 AI Pipeline → 企业 Agent 架构
的路线。
我认为这会比你继续在纯 Python/纯 LangChain 生态里打转,更适合你现在所处的 2026 Agent 浪潮。(LangChain)
评论
请登录后发表评论
暂无评论,快来发表第一条评论吧!