從AI 模型到代理:什麼讓一個系統具有「代理性」?
AI 近年來,機器學習模型與大型語言模型(LLMs)取得了驚人的進展,在自然語言處理方面展現出超乎尋常的進步,能夠生成並理解語言。但當前真正發生的轉變,在於現代AI (多模態)代理的開發,這些代理能夠規劃並執行端到端的任務。試想早期專用AI 系統(例如1997年IBM的「深藍」國際象棋引擎)與當今系統之間的差異:當時的系統雖能輕而易舉地擊敗人類冠軍,但僅專注於一項特定任務。 相較之下,當今的隨機式、善用工具的AI 代理程式,能夠規劃並執行諸如「下週預訂前往舊金山的行程,預算不超過 1,000 美元」這類含糊不清的端到端任務,此類任務不僅需要多步驟操作,更需在過程中進行自主決策。
我最近取得了「克勞德認證建築師(基礎級)」資格,這個過程對我理解「能動性AI 」的結構、複雜性與機遇,具有無可估量的價值。我迫不及待想分享其中的一些核心原則。
首先,讓我們闡明具有代理特性的AI 架構 與傳統的AI 有何不同。代理的核心特徵在於其能夠運用模型、外部工具及記憶體,來擴展其所基於的大型語言模型的基本能力。 代理的運作方式在於自主規劃目標,著重將複雜的工作流程分解為多步驟任務,並在許多情況下實現並行執行。正如我們稍後將探討的,這最後一點正是代理式架構最具吸引力的特點之一:透過運用具備專門技能與目標的不同代理,協調者能夠有效地委派任務,並整合結果。這遠比試圖透過單一使用者請求來解決複雜問題來得強大。
另一種思考「代理」的方式,是透過它們所能處理的查詢類型來理解。大型語言模型(LLM)可以接收單一查詢,並經常產生令人印象深刻且看似深思熟慮的結果。 另一方面,代理系統則能接收解決複雜任務的指派,這需要透過「感知 → 推理 → 行動 → 觀察 → 更新記憶 → 重複 」的迭代循環,直至達成目標為止。此外,代理系統不僅侷限於大型語言模型(LLM)之中,更能連接外部系統以擴充其知識並採取行動。根據使用者的偏好,許多代理系統能在極少的人工介入下運作。
從商業角度來看,近年來,隨著各組織試圖從聊天式輔助系統轉向自主工作流程,具備自主性的AI 系統已成為企業討論的主流話題。隨著代理技能在企業級規模下接觸公司數據,其在任務自動化及處理日益複雜任務方面的能力,將能顯著拓展其在企業各方面的應用範圍。
AI 核心代理架構組件
大多數基於代理的AI 架構均可分解為四項核心能力,不過根據所解決問題的具體性質,每種類型可由單一代理或多個代理組成。
- 一個協調層 負責管理整體任務,並將組件委派給子代理
- 認知 這些任務的核心在於理解任務內容與目的,並處理通常具有重要價值的資料來源,以找出相關資訊
- 推理 推理任務需要理解任務內容,並運用相關素材來進行推理,進而確定理想的行動方針
- 以行動為導向的任務 連線至外部服務,這些服務通常透過 MCP(模型上下文協定)伺服器發佈其可用功能,以實現外部動作。
在接下來的章節中,我們將深入探討這些組成部分,以了解代理式AI 系統的建構方式,以及成功且高效的代理式系統所需的諸多獨特設計要點。本部落格無意涵蓋用於連接代理式系統的眾多技術標準與介面,亦不涉及許多分散式系統的複雜環境,而是針對當前採用的關鍵取捨與典型設計方法,提供一個整體性的介紹。
感知:代理系統如何接收並理解世界
感知是「感官」層面,透過此層面,具備代理能力的AI 得以理解世界。為了理解當前任務的背景,代理需要讀取並理解各類廣泛不同類型的数据:
- 自然語言輸入,例如聊天訊息、電子郵件及服務單
- 非結構化文件輸入,例如 規格書、網頁、PDF 檔案等。將這類高密度、非結構化的內容轉化為代理架構所能理解的輸入,至關重要,因為這能讓「AI 」代理具備人類通常所感知的那種情境脈絡。
- 結構化資料輸入,例如 SQL 資料庫、感測器資料、音訊、影片或其他物件儲存形式。
無論是哪種資料類型,其核心挑戰都在於將其轉換為結構化表示形式,以便推理引擎能高效地進行處理。
協調與推理:AI 代理人的認知引擎
代理架構的核心在於協調與推理層。推理層是 AI 代理的「大腦」,負責選擇目標、將其分解為計畫、選取工具,並決定何時視為任務「完成」。目前,大型語言模型(LLMs,例如 GPT‑4.1、Gemini Pro、Claude、LLaMA 各變體等)是典型的推理引擎,並構成該架構的核心。
單一大型語言模型(LLM)調用與代理式方法的差異在於:推理層(包括整體協調器)會將任務分解為子目標,並據此決定何時將任務委派給其他代理、何時諮詢人類、何時使用工具,以及何時因目標未能達成而終止任務。 在代理式系統中,多代理架構中的每個子代理都會被賦予一項比整體任務更為聚焦的特定任務。該特定任務附帶其專屬的角色、系統提示詞及技能,以協助代理專注並更有效地完成其專門任務。
根據任務性質,推理代理會經過精心設計,以確保其工作範圍能在大型語言模型(LLM)的限制內達成。當提示文字長度達到上限、資料以非結構化格式提供,或是任務規模過大時,便可能出現「幻覺」或「遺忘」關鍵事實的情況。 在這些情況下,可能需要採用多代理工作流程,將大型任務重新結構化為串行或並行代理,由各代理處理較小的子集。多代理協作的複雜性在於管理這些子任務,這也增加了協調者的協調複雜度。
記憶:自主AI 系統的短期與長期脈絡
基於代理的AI 也必然仰賴持久性記憶體,以確保代理能追蹤其任務進度,特別是在代理需跨時間、跨多個步驟、跨會話或執行連續任務的情況下。其中最簡單的一項便是對話歷史紀錄——由於大型語言模型(LLMs)本質上是無狀態的,因此代理框架必須將此歷史紀錄回傳給推理層。為了確保任務進行過程中對話不會溢出,必須進行結構化的上下文管理。
除了對話記錄本身的短期記憶之外,還存在於持久儲存之外的長期記憶,例如 使用者檔案、過往事件、專案歷史紀錄,或是透過向量資料庫、知識圖譜或關係型/SQL 儲存庫實現的特定領域文件。透過運用長期記憶,AI 代理程式得以建立 RAG(檢索增強生成)管道,例如讓客戶服務專員能檢索過往的服務單與購買紀錄,藉此提供個人化的回覆。
行動:工具的使用、執行與現實世界中的影響
代理式AI 的核心在於,能夠透過呼叫工具、API、資料庫或其他代理程式,並產生程式碼、工單或配置變更,將 AI 與決策連結至現實世界的變化。截至本文撰寫之時,工具通常由MCP公開,該MCP會發布可供AI 使用的工具,並為輸入與輸出提供結構化的模式。
工具的使用具有重要的影響。截至目前為止,若為工具賦予過多功能,或提供過於複雜的模式,將可能導致混淆,使推理引擎選擇錯誤的工具,或造成上下文視窗過載。將代理程式細分為專門化的任務,並為每個子任務提供相應的工具,是確保取得更好成效的一種策略。
同樣關鍵的是確保足夠的安全性,使代理程式僅能存取經核准的工具,並針對不確定、高風險、涉及重大財務影響等領域,採用人工監督機制。錯誤處理至關重要,既要確保工具能成功執行,也要確保當工具執行失敗時,代理程式能妥善處理該情況(例如進行受控的重試),同時還需建立防護措施,以確保工具調用符合業務邏輯或安全政策。
系統架構類型:單代理、多代理及混合系統
代理系統的複雜程度各不相同。如今,單代理系統可處理針對性明確的工作流程;多代理系統則用於處理複雜或大規模的問題;而混合式架構則在各層級中融合了人類與AI 代理。
- 單一代理架構: 一個具備獨立推理能力、記憶體及工具的AI 代理程式,在迴圈中持續運行。典型範例包括客戶支援代理程式、文件編撰的內部助理,以及報表生成代理程式。
- 多代理架構: 此類架構由多個專門化的代理(例如「研究員」、「規劃者」、「執行者」、「審查者」)組成,並透過訊息進行協調。多代理人工智慧的設計模式涵蓋分層式(協調者+工作節點)、去中心化的點對點網路,以及領導權可根據任務情境進行轉換的混合型架構。每種架構各有其優勢與複雜性。
最佳做法是先從單代理系統著手,僅在需要因應特定的額外需求(例如:專業化、並行化、驗證)時,才轉向多代理系統,以避免不必要的複雜性。
展望
代理式計算(AI )能加速新功能的開發,目前正廣泛應用於各行各業及各類使用情境中。隨著越來越多的服務發布允許代理存取的 MCP 介面(無論是輸入或輸出操作),代理的科學原理與功能正迅速演進。Sonatus 正大力投資此領域,並交付複雜的多代理系統,以支援從投產前 測試與驗證到售後服務的各種使用情境。 我們對這種新型運算方式的潛力,以及它能為客戶帶來的效益感到非常興奮。
