文档索引
获取完整文档索引: https://docs.crewai.com.cn/llms.txt
在深入了解之前,请使用此文件来浏览所有可用页面。
CrewAI 的 LLM 选择方法
我们不主张盲目推荐特定模型,而是提倡一种思考框架,帮助您根据具体的用例、限制条件和要求做出明智的决策。LLM 领域发展迅速,新模型不断涌现,现有模型也在频繁更新。最重要的是建立一套系统的评估方法,无论市面上出现何种模型,该方法依然适用。本指南侧重于战略思考而非特定模型推荐,因为 LLM 领域演变极其迅速。
快速决策框架
核心选择框架
a. 任务优先的思维方式
LLM 选择中最关键的一步是了解任务的实际需求。团队往往只根据一般声誉或基准测试分数来选择模型,而没有仔细分析其具体需求。这种做法要么会导致用昂贵复杂的模型处理简单任务而造成过度设计,要么会导致用能力不足的模型去执行需要高度智能的复杂任务。- 推理复杂度
- 输出要求
- 上下文需求
- 简单任务代表了日常 AI 工作的大部分,包括基本的指令遵循、直接的数据处理和简单的格式化操作。这些任务通常有明确的输入和输出,歧义极小。认知负荷较低,模型主要需要执行显式指令,而非进行复杂的推理。
- 复杂任务需要多步推理、战略思考以及处理模糊或不完整信息的能力。这可能涉及分析多个数据源、制定综合策略,或将问题拆解为更小的组件。模型需要在多个推理步骤中保持上下文,且通常必须进行非显式说明的推理推断。
- 创造性任务需要不同类型的认知能力,侧重于生成新颖、引人入胜且语境恰当的内容。这包括讲故事、创作营销文案和创造性解决问题。模型需要理解细微差别、语气和受众,同时产生感觉自然而非格式化的内容。
b. 模型能力映射
理解模型能力需要超越营销口号和基准分数,去探究不同模型架构和训练方法的基本优势与局限性。推理模型
推理模型
推理模型代表了专为复杂、多步思考任务而设计的专业类别。当问题需要仔细分析、战略规划或系统化问题拆解时,这些模型表现卓越。它们通常采用思维链(Chain-of-Thought)或思维树(Tree-of-Thought)处理等技术来逐步解决复杂问题。推理模型的优势在于其在扩展推理链中保持逻辑一致性的能力,以及将复杂问题拆解为可管理组件的能力。它们对于战略规划、复杂分析以及那些推理质量比响应速度更重要的场景尤为有价值。然而,推理模型往往在速度和成本上有所取舍。它们可能不太适合那些不需要复杂推理的创造性任务或简单操作。当您的任务涉及需要系统化、逐步分析的真正复杂性时,请考虑这些模型。
通用模型
通用模型
通用模型提供了 LLM 选择中最平衡的方法,在广泛的任务中提供稳健的性能,而不在任何特定领域进行过度专业化。这些模型在多样化的数据集上进行训练,并针对多功能性而非特定领域的峰值性能进行了优化。通用模型的主要优点是其在各类工作中的可靠性和可预测性。它们能胜任大多数标准业务任务,从研究分析到内容创作和数据处理。这使其成为需要在不同工作流中获得一致性能的团队的绝佳选择。虽然通用模型在特定领域可能达不到专业替代方案的峰值性能,但它们提供了运营上的简便性和更低的模型管理复杂度。它们通常是新项目的最佳起点,允许团队在考虑通过更专业的模型进行优化之前,先行了解自己的具体需求。
快速高效模型
快速高效模型
快速高效模型优先考虑速度、成本效益和资源效率,而非复杂的推理能力。这些模型针对高吞吐量场景进行了优化,在这些场景中,快速响应和低运营成本比细致的理解或复杂推理更重要。这些模型在涉及常规操作、简单数据处理、函数调用和认知要求相对直接的高容量任务中表现出色。它们对于需要快速处理大量请求或在严格预算限制下运营的应用程序特别有价值。高效模型的一个关键考虑因素是确保它们的能力符合您的任务要求。虽然它们能有效处理许多常规操作,但在需要细致理解、复杂推理或复杂内容生成的任务上可能会力不从心。它们最适合用于速度和成本比复杂性更重要的明确的常规操作。
创造性模型
创造性模型
创造性模型专门针对内容生成、写作质量和创造性思维任务进行了优化。这些模型通常擅长理解细微差别、语气和风格,同时产出感觉自然且真实的引人入胜、语境恰当的内容。创造性模型的优势在于其调整写作风格以适应不同受众、保持一致的语音和语气以及生成能有效吸引读者的内容的能力。它们在涉及讲故事、营销文案、品牌沟通以及其他以创造力和参与度为首要目标的内容任务上通常表现更好。在选择创造性模型时,不仅要考虑它们生成文本的能力,还要考虑它们对受众、背景和目的的理解。最好的创造性模型能够调整输出以匹配特定的品牌声音,针对不同的受众群体,并在扩展的内容中保持一致性。
开源模型
开源模型
开源模型在成本控制、定制化潜力、数据隐私和部署灵活性方面提供了独特的优势。这些模型可以在本地或私有基础设施上运行,从而实现对数据处理和模型行为的完全控制。开源模型的主要好处包括消除了每 Token 成本、能够针对特定用例进行微调、完全的数据隐私以及摆脱对外部 API 提供商的依赖。对于有严格数据隐私要求、预算限制或特定定制需求的组织来说,它们特别有价值。然而,开源模型需要更多的技术专长来有效部署和维护。团队需要考虑基础设施成本、模型管理复杂性以及保持模型更新和优化所需的持续工作量。当计入技术开销时,总拥有成本可能比基于云的替代方案更高。
战略配置模式
a. 多模型方法
最复杂的 CrewAI 实现通常会战略性地使用多个模型,根据不同智能体的具体角色和要求为其分配不同的模型。这种方法允许团队通过为每种工作类型使用最合适的模型来同时优化性能和成本。 规划智能体受益于能够处理复杂战略思考和多步分析的推理模型。这些智能体通常充当操作的“大脑”,制定策略并协调其他智能体的工作。另一方面,内容智能体在擅长写作质量和受众参与的创造性模型下表现最好。处理常规操作的处理智能体可以使用优先考虑速度和成本效益的高效模型。 示例:研究与分析 Crewb. 组件特定选择
- 管理者 LLM
- 函数调用 LLM
- 智能体特定覆盖
管理者 LLM 在分层 CrewAI 流程中起着至关重要的作用,充当多个智能体和任务的协调点。该模型需要擅长委派、任务优先级排序以及在多个并发操作中保持上下文。有效的管理者 LLM 需要强大的推理能力来做出正确的委派决策,稳定的性能以确保可预测的协调,以及出色的上下文管理以同时跟踪多个智能体的状态。该模型需要理解不同智能体的能力和局限性,同时优化任务分配以实现效率和质量。对于管理者 LLM 来说,成本考量尤为重要,因为它们参与了每一个操作。该模型需要在提供足够的协调能力的同时保持高频使用的成本效益。这通常意味着寻找那些提供良好推理能力而不必支付最复杂选项的高溢价的模型。
任务定义框架
a. 关注清晰度而非复杂度
在决定 CrewAI 输出质量方面,有效的任务定义往往比模型选择更重要。定义明确的任务提供了清晰的方向和背景,使即使是普通的模型也能表现良好,而定义糟糕的任务即使是复杂的模型也可能导致产生令人不满的结果。有效的任务描述
有效的任务描述
最好的任务描述在提供足够的细节和保持清晰度之间取得了平衡。它们应足够清晰地定义具体目标,使对成功的定义毫无歧义,同时以足够的细节解释方法或方法论,使智能体理解如何进行。有效的任务描述包括有助于智能体理解更广泛目的及其工作限制的相关上下文和约束条件。它们将复杂的工作拆解为可以系统执行的重点步骤,而不是呈现难以系统处理的压倒性的、多方面的目标。常见错误包括对目标描述得太模糊、未能提供必要的上下文、设置不明确的成功标准,或将多个不相关的任务合并到一个描述中。目标是提供足够的信息让智能体成功,同时保持对单一清晰目标的关注。
预期输出指南
预期输出指南
预期输出指南充当任务定义与智能体之间的契约,明确规定交付成果的样子以及评估方式。这些指南应描述所需的格式和结构,以及为了被视为完成,必须包含的关键要素。最好的输出指南提供了质量指标的具体示例,并足够清晰地定义了完成标准,以便智能体和人类审核员都能评估任务是否已成功完成。这减少了歧义并有助于确保多个任务执行间的一致性。避免使用适用于任何任务的通用输出描述、缺失会导致智能体猜测结构的格式规范、使评估变得困难的不明确质量标准,或未能提供有助于智能体理解期望的示例或模板。
b. 任务排序策略
- 顺序依赖
- 并行执行
当任务建立在先前的输出之上、信息从一个任务流动到另一个任务,或质量取决于先决工作的完成时,顺序任务依赖是必不可少的。这种方法确保每个任务都能获得其成功所需的信息和上下文。有效实现顺序依赖需要使用上下文参数来链接相关任务,通过任务进展逐步构建复杂度,并确保每个任务产生的输出作为后续任务的有意义输入。目标是保持依赖任务之间的逻辑流程,同时避免不必要的瓶颈。当任务之间有清晰的逻辑演进,且一个任务的输出切实改善了后续任务的质量或可行性时,顺序依赖效果最好。但是,如果管理不当,它们会造成瓶颈,因此确定哪些依赖是真正必要的,哪些仅仅是方便的,这一点很重要。
优化智能体配置以实现 LLM 性能提升
a. 角色驱动的 LLM 选择
智能体角色的具体性直接决定了哪些 LLM 能力对实现最佳性能最为重要。这创造了一个将精确模型优势与智能体职责相匹配的战略机会。 通用与特定角色对 LLM 选择的影响: 定义角色时,思考对于智能体将处理的任务最有价值的特定领域知识、工作风格和决策框架。角色定义越具体、语境越丰富,模型就能越有效地体现该角色。- “研究分析师” → 推理模型(GPT-4o, Claude Sonnet)用于复杂分析
- “内容编辑” → 创造性模型(Claude, GPT-4o)用于写作质量
- “数据处理器” → 高效模型(GPT-4o-mini, Gemini Flash)用于结构化任务
- “API 协调员” → 函数调用优化模型(GPT-4o, Claude)用于工具使用
b. 背景故事作为模型上下文放大器
战略性的背景故事通过提供通用提示无法实现的领域特定上下文,将您所选 LLM 的有效性成倍增加。
- 领域经验:“10 年以上企业 SaaS 销售经验”
- 具体专长:“专精于 B 轮及以上融资的技术尽职调查”
- 工作风格:“偏好基于数据的决策,并带有清晰的文档记录”
- 质量标准:“坚持引用来源并展示分析工作”
c. 全面的智能体-LLM 优化
最有效的智能体配置在角色具体性、背景故事深度和 LLM 选择之间创造了协同效应。每个要素都相互加强,以最大限度地提高模型性能。 优化框架:- ✅ 角色具体性:清晰的领域和职责
- ✅ LLM 匹配:模型优势与角色要求一致
- ✅ 背景故事深度:提供 LLM 可利用的领域上下文
- ✅ 工具集成:工具支持智能体的专业功能
- ✅ 参数调整:温度和设置针对角色需求进行优化
实践实现清单
不再重复战略框架,这里是一份在 CrewAI 中实施 LLM 选择决策的战术清单审计您当前的设置
审查内容
- 所有智能体默认是否使用相同的 LLM?
- 哪些智能体处理最复杂的推理任务?
- 哪些智能体主要进行数据处理或格式化?
- 是否有智能体高度依赖工具?
通过企业级测试进行验证
一旦您将智能体部署到生产环境
- 使用 CrewAI AMP 平台 对您的模型选择进行 A/B 测试
- 使用真实输入运行多次迭代,以测量一致性和性能
- 在您的优化设置中比较成本与性能
- 与团队分享结果,进行协作决策
何时使用不同模型类型
- 推理模型
- 创造性模型
- 高效模型
- 开源模型
当任务需要真正的多步逻辑思考、战略规划或从系统分析中受益的高级决策时,推理模型变得必不可少。这些模型在问题需要被拆解为组件并进行系统分析,而非通过模式匹配或简单指令遵循处理时表现卓越。考虑将推理模型用于商业战略制定、需要从多个来源提取洞察的复杂数据分析、每个步骤都依赖于先前分析的多步问题解决,以及需要考虑多个变量及其交互的战略规划任务。然而,推理模型往往伴随着更高的成本和更慢的响应时间,因此最好将其保留用于那些其复杂能力能带来真正价值的任务,而不是将其用于不需要复杂推理的简单操作。
常见的 CrewAI 模型选择陷阱
“一刀切”陷阱
“一刀切”陷阱
问题:在 crew 中为所有智能体使用相同的 LLM,无论其具体角色和职责如何。这通常是默认方法,但很少是最优的。现实示例:为战略规划经理和数据提取智能体都使用 GPT-4o。经理需要值得高昂成本的推理能力,但数据提取器完全可以用 GPT-4o-mini 以一小部分价格实现同样好的效果。CrewAI 解决方案:利用智能体特定的 LLM 配置来匹配模型能力与智能体角色:
忽视 Crew 级别与智能体级别 LLM 的层次结构
忽视 Crew 级别与智能体级别 LLM 的层次结构
问题:不了解 CrewAI 的 LLM 层次结构如何运作——crew LLM、管理者 LLM 和智能体 LLM 设置可能会冲突或协调不当。现实示例:设置 crew 使用 Claude,但智能体配置为使用 GPT 模型,导致不一致的行为和不必要的模型切换开销。CrewAI 解决方案:战略性地规划您的 LLM 层次结构:
函数调用模型不匹配
函数调用模型不匹配
问题:基于通用能力选择模型,而忽略了工具密集型 CrewAI 工作流的函数调用性能。现实示例:为主要需要调用 API、搜索工具或处理结构化数据的智能体选择侧重创造性的模型。智能体在工具参数提取和可靠的函数调用方面会遇到困难。CrewAI 解决方案:优先考虑工具密集型智能体的函数调用能力:
未经测试的过早优化
未经测试的过早优化
问题:基于理论性能做出复杂的模型选择决策,而没有通过实际的 CrewAI 工作流和任务进行验证。现实示例:基于任务类型实施复杂的模型切换逻辑,而不测试性能增益是否证明运营复杂性是合理的。CrewAI 解决方案:从简单开始,然后根据实际性能数据进行优化:
忽视上下文和内存限制
忽视上下文和内存限制
问题:不考虑模型上下文窗口如何与 CrewAI 的内存和智能体间的上下文共享交互。现实示例:在需要跨多个任务迭代维护对话历史的智能体中,或在具有广泛智能体间通信的 crew 中,使用短上下文模型。CrewAI 解决方案:将上下文能力与 crew 的通信模式匹配。
测试与迭代策略
企业级模型验证
对于认真对待优化 LLM 选择的团队,CrewAI AMP 平台提供了远远超越基础 CLI 测试的复杂测试能力。该平台实现了全面的模型评估,帮助您围绕 LLM 策略做出数据驱动的决策。
- 多模型比较:同时测试多个 LLM 在相同任务和输入下的表现。并行比较 GPT-4o、Claude、Llama、Groq、Cerebras 和其他领先模型之间的性能,以确定最适合您特定用例的选择。
- 统计严谨性:使用一致的输入配置多次迭代,以测量可靠性和性能差异。这有助于识别不仅表现良好,且在多次运行中表现一致的模型。
- 现实验证:使用您的真实 crew 输入和场景,而非合成基准。该平台允许您使用特定的行业背景、公司信息和实际用例进行测试,以实现更准确的评估。
- 全面分析:获取跨所有已测试模型的详细性能指标、执行时间和成本分析。这使得决策能够基于数据,而不是依赖通用模型声誉或理论能力。
- 团队协作:与团队分享测试结果和模型性能数据,实现项目间的协作决策和一致的模型选择策略。
企业平台将模型选择从猜测转变为数据驱动的过程,使您能够根据实际用例和要求验证本指南中的原则。
关键原则总结
任务驱动的选择
根据任务的实际需求而非理论能力或通用声誉来选择模型。
能力匹配
使模型优势与智能体角色和职责保持一致,以实现最佳性能。
战略一致性
在相关组件和工作流中保持连贯的模型选择策略。
实践测试
通过实际使用而非仅仅通过基准测试来验证选择。
迭代改进
从简单开始,并根据实际性能和需求进行优化。
运营平衡
平衡性能要求与成本和复杂性限制。
记住:最好的 LLM 选择是在您的运营限制下持续提供所需结果的模型。专注于先理解您的需求,然后选择最符合这些需求的模型。
当前模型格局(2025 年 6 月)
按类别领先的模型
下表展示了当前各类别中表现顶尖的模型样本,并附带了它们对 CrewAI 智能体适用性的指南这些表格/指标展示了各类别中选定的领先模型,并非详尽无遗。除了列出的模型外,还有许多出色的模型。目标是说明需要寻找的能力类型,而非提供完整目录。
- 推理与规划
- 编码与技术
- 速度与效率
- 平衡性能
管理者 LLM 和复杂分析的最佳选择
这些模型擅长多步推理,是需要制定策略、协调其他智能体或分析复杂信息的智能体的理想选择。
| 模型 | 智能得分 | 成本($/百万 Token) | 速度 | 在 CrewAI 中的最佳用途 |
|---|---|---|---|---|
| o3 | 70 | $17.50 | 快速 | 用于复杂多智能体协调的管理者 LLM |
| Gemini 2.5 Pro | 69 | $3.44 | 快速 | 战略规划智能体,研究协调 |
| DeepSeek R1 | 68 | $0.96 | 中等 | 预算敏感型 crew 的性价比推理 |
| Claude 4 Sonnet | 53 | $6.00 | 快速 | 需要细致理解的分析智能体 |
| Qwen3 235B (Reasoning) | 62 | $2.63 | 中等 | 用于推理任务的开源替代方案 |
当前模型的选择框架
高性能 crew
高性能 crew
当性能是优先事项时:对管理者 LLM 和关键智能体使用 o3、Gemini 2.5 Pro 或 Claude 4 Sonnet 等顶尖模型。这些模型在复杂推理和协调方面表现卓越,但伴随着更高的成本。策略:实施多模型方法,其中高级模型处理战略思考,而高效模型处理常规操作。
成本意识型 crew
成本意识型 crew
当预算是主要限制时:专注于 DeepSeek R1、Llama 4 Scout 或 Gemini 2.0 Flash 等模型。这些模型在显著降低的成本下提供了强劲的性能。策略:为大多数智能体使用高性价比模型,仅将高级模型保留用于最关键的决策角色。
专业化工作流
专业化工作流
对于特定的领域专长:选择针对您主要用例优化的模型。Claude 4 系列用于编码,Gemini 2.5 Pro 用于研究,Llama 405B 用于函数调用。策略:根据 crew 的主要功能选择模型,确保核心能力与模型优势一致。
企业与隐私
企业与隐私
对于数据敏感的操作:考虑 Llama 4 系列、DeepSeek V3 或 Qwen3 等开源模型,它们可以在保持竞争性能的同时在本地部署。策略:在私有基础设施上部署开源模型,接受为数据控制可能带来的性能取舍。
模型选择的关键考量
- 性能趋势:当前格局显示了以推理为重点的模型(o3, Gemini 2.5 Pro)与平衡型模型(Claude 4, GPT-4.1)之间的激烈竞争。DeepSeek R1 等专业模型提供了出色的性价比。
- 速度与智能的权衡:Llama 4 Scout 等模型优先考虑速度(2,600 tokens/s)同时保持合理的智能,而 o3 等模型在牺牲速度和价格的情况下最大化推理能力。
- 开源可行性:开源模型与专有模型之间的差距在不断缩小,Llama 4 Maverick 和 DeepSeek V3 等模型以极具吸引力的价格点提供了竞争性性能。快速推理提供商在开源模型方面表现尤为突出,通常比专有替代方案提供更好的速度-成本比。
测试至关重要:排行榜排名提供通用指南,但您的特定用例、提示风格和评估标准可能会产生不同的结果。在做出最终决定之前,请始终结合您的实际任务和数据测试候选模型。
实践实现策略
识别专业需求
确定您的 crew 是否有特定的要求(编码、推理、速度),这些需求将受益于像用于开发的 Claude 4 Sonnet 或用于复杂分析的 o3 等专业模型。对于速度关键的应用,除了模型选择外,请考虑像 Groq 这样快速的推理提供商。
