Research note / 2026/06/19

Agent基础概念 + LLM基础

Agent应用开发 · Day 1 学习笔记

Agent基础概念 + LLM基础封面

日期:2026-06-03
主题:Agent基础概念 + LLM基础
进度:8/40 概念


一、Agent基础概念

1. 什么是AI Agent

定义:AI Agent 是一个能自主决策使用工具围绕目标持续工作的智能系统。

最小定义三要素

条件含义反例自主性能自己决定下一步做什么脚本是人写死流程的,不算工具使用能调用外部能力(API、数据库、代码执行)纯聊天没有工具,不算目标驱动围绕一个目标持续工作,不是单轮问答一问一答的chatbot,不算

核心公式

Agent = LLM(大脑)+ 自主决策(循环)+ 工具使用(手脚)

Chatbot vs Agent 的区别

Chatbot:用户问"帮我订机票" → 回答"建议你去携程搜索"
Agent:  用户问"帮我订机票" → 自己查航班 → 比价 → 锁座 → 预订 → 返回结果

2. Agent与传统软件的区别

维度传统软件AI Agent执行逻辑人写死的 if/elseLLM 动态决策输入输出确定性——同样输入同样输出非确定性——同样任务可能走不同路径错误处理预定义的异常分支遇到未知情况自己想办法扩展方式写新代码加新工具描述就行开发范式编程 = 写逻辑编程 = 定义目标 + 提供工具

类比

  • 传统软件 = 流水线工人(精确但僵化)
  • Agent = 实习生(灵活但可能犯错)

开发心态转变:不再追求 100% 确定性,而是管理不确定性


3. Agent的核心能力

四大能力构成闭环:

感知 → 推理 → 行动 → 记忆/学习
 ↑                    ↓
 └────────────────────┘

能力含义技术对应感知接收信息(用户输入、工具返回、环境变化)文档解析 + NLU推理分析、规划、决策(核心中的核心)LLM 的思维链行动调用工具、生成回复、执行操作Function Calling记忆记住经验、改进策略记忆系统

推理能力的具体表现

  • 任务分解:大目标拆成小步骤
  • 工具选择:这一步该调哪个工具
  • 异常处理:工具返回错误时怎么办
  • 优先级判断:多个子任务哪个先做

区分 Agent 和脚本的关键:脚本也能感知和行动,但脚本不会思考


4. Agent的应用场景与边界

适合用 Agent 的场景

  • 任务模糊,需要判断(如”调研竞品定价”)
  • 多步骤,步骤间有依赖(如”分析数据→生成图表→写报告”)
  • 需要调用多种外部能力(如客服系统)
  • 用户输入多样,无法穷举(如自然语言意图识别)

不适合用 Agent 的场景

  • 流程固定、确定性要求高(如银行转账)
  • 延迟敏感、成本敏感(如实时游戏AI)
  • 简单单步任务(如翻译一句话)
  • 合规/审计要求严格(如医疗诊断建议)

判断公式

用 Agent 的信号:任务需要**“思考”——不是执行一个已知步骤,而是决定该执行什么步骤**。

Agent 当前的硬限制

限制说明幻觉可能编造不存在的API、虚构数据推理深度有限超过5-10步的复杂推理容易出错非确定性同一个任务两次执行结果可能不同成本每次推理都消耗Token,复杂任务费用高


二、LLM基础

5. Transformer架构概述

作为 Agent 开发者,不需要推公式,但需要理解:LLM 的能力从哪来,限制从哪来。

三个关键点

① 自注意力机制:理解”关系”

模型处理每个词时,能”看到”并”关注”整个句子中所有相关的词,但注意力权重不均匀——有些词重点关注,有些几乎忽略。

"银行的利率很高"  → "银行"主要关注"利率"(金融机构)
"河岸的风景很美"  → "岸"主要关注"风景"(河边)

② 下一个 Token 预测:LLM 本质是”接话机器”

给定前面所有文字,预测下一个最可能的词。它不是在”理解”,而是在做概率预测。这就是为什么 LLM 有时会”一本正经地胡说八道”。

③ 分层处理:不同层关注不同东西

层级关注什么例子浅层语法、指代”他”→“小明”中层语义、因果”没及格”→“没放弃”→“通过补考”深层抽象推理、意图理解整个句子在讲”坚持”

模型越深(参数越多),推理能力越强。


6. Token与上下文窗口

Token 是什么:LLM 处理文本的最小单位,介于字符和词之间。

英文:"ChatGPT is great"  →  ["Chat", "GPT", " is", " great"]  = 4 tokens
中文:"人工智能真厉害"      →  ["人工", "智能", "真", "厉害"]    = 4 tokens

为什么关心 Token:LLM 按 Token 计费。

模型输入价格输出价格GPT-4o2.5/百万token2.5 / 百万token10 / 百万tokenClaude Sonnet3/百万token3 / 百万token15 / 百万tokenDeepSeek V30.27/百万token0.27 / 百万token1.1 / 百万token

上下文窗口:模型一次能”看到”的最大 Token 数。超过窗口,最早的内容会被丢掉。

成本计算示例

一个 Agent 每轮对话:
  系统提示词 500 + 对话历史 2000 + 工具结果 1000 + 输出 500 = 4000 tokens
一天 1000 轮 → 400万 tokens → GPT-4o 约 $10/天

对 Agent 开发的影响

  • 成本控制:提示词越长越贵
  • 记忆管理:上下文有限,需要压缩/摘要策略
  • 工具描述:工具越多,留给推理的空间越少
  • 模型选择:复杂任务需要大窗口模型

经验法则:8K 窗口基本不能做 Agent,最低 32K,复杂任务需要 128K+。


7. 模型能力与局限性

模型擅长的

  • 自然语言理解(语义理解极强)
  • 文本生成(写邮件、总结、代码)
  • 有限深度推理(10步以内可靠)
  • 格式遵循(JSON、模板)
  • 多语言处理

模型不擅长的(Agent 开发必知)

弱点对 Agent 的影响幻觉可能调用不存在的工具、编造数据数学计算复杂计算必须交给工具实时信息训练数据有截止日期长程推理超过10步错误累积严重否定指令”不要提到苹果”反而出现苹果上下文迷失对话太长会忘记前面内容

幻觉是 Agent 最致命的问题:Agent 会把幻觉当真然后执行。

防护原则

永远不要无条件信任 LLM 的输出。

  • 工具返回的原始数据 → 可信
  • LLM 转述的数据 → 不可信
  • 让 LLM 做展示层,不做数据层

8. 主流模型选型

| 模型 | 推理能力 | 速度 | 上下文 | 成本 | 适用场景 |

| --------------- | -------- | ---- | ------ | ------ | --------------------- |

| Claude Opus 4 | ⭐⭐⭐⭐⭐ | 慢 | 200K | 高 | 复杂推理、长文档 |

| Claude Sonnet 4 | ⭐⭐⭐⭐ | 中 | 200K | 中 | Agent首选,性价比最高 |

| GPT-4o | ⭐⭐⭐⭐ | 中 | 128K | 中 | 通用任务、多模态 |

| GPT-4o mini | ⭐⭐⭐ | 快 | 128K | 低 | 简单任务、高并发 |

| DeepSeek V3 | ⭐⭐⭐⭐ | 中 | 128K | 极低 | 成本敏感场景 |

| Llama 3.1 70B | ⭐⭐⭐ | 中 | 128K | 自部署 | 数据隐私要求高 |

选型原则

推理复杂度 ↑
           │  Claude Opus    GPT-4o
           │  (最强推理)      (全能)
           │
           │─────────────────────→ 成本
           │
           │  DeepSeek V3    Claude Sonnet
           │  (便宜够用)      (性价比之王)
           ↓

混合模型策略(推荐):

  • 规划用强模型(Opus)
  • 执行用中模型(Sonnet)
  • 简单活用小模型(mini)

本地部署场景(数据隐私要求高时):

  • 用 Ollama 本地运行模型
  • 中文场景推荐 Qwen2.5 系列
  • 根据显存选模型大小(16G→14B,24G→32B,48G→72B)

三、Day 1 核心认知总结

  1. Agent = 大脑 + 决策循环 + 工具,三者缺一不可
  2. 非确定性是双刃剑——灵活但需要管理不确定性
  3. 推理是 Agent 的核心能力——脚本能感知和行动,但不会思考
  4. 用 Agent 的信号:任务需要”思考”而非执行已知步骤
  5. Token 是钱,窗口是空间——做 Agent 必须精打细算
  6. 永远不无条件信任 LLM——工具返回的可信,LLM 转述的不可信
  7. 混合模型策略——规划用强的,执行用中的,省钱用小的

Discussion

评论

评论暂未开放

站点尚未配置 GitHub Discussions。文章阅读不受影响,也不会再发起无效的 GitHub 登录请求。