你還在手動餵資料給AI?這套「技能系統」讓Claude像資深員工一樣自動進化
你有沒有這種經驗?花了三個小時把公司內部流程、產品規格、客戶應對話術一股腦地餵給Claude,結果隔天打開對話框,它又變回那個一問三不知的「新鮮人」。你必須重新把那些該死的文件再貼一次,然後祈禱這次它記得住。
這種感覺,就像你每天都要跟同一個同事自我介紹。荒謬至極,對吧?
但你以為這是AI的限制,其實這是你的方法錯了。你不是在跟一個聊天機器人對話,你是在訓練一個員工。而大多數人,連最基礎的「員工手冊」和「績效考核」都沒給它。
今天,我們要徹底拆解一套由AI應用高手Peter Yang示範的終極工作流。這不是那種「教你怎麼寫提示詞」的初階教學,而是一套能讓Claude擁有長期記憶與自主校準能力的「技能系統」。看完你會發現,過去你以為的「AI極限」,其實只是你的認知牢籠。
為什麼你的Claude總是「笨笨的」?因為你沒給它「技能」
先問一個直擊靈魂的問題:你覺得Claude的能力上限在哪裡?
很多人會說:「它會寫程式、會分析資料、會摘要文章,但就是記不住我上次交代過的事。」
錯了。Claude的能力上限,取決於你如何定義它的角色。如果你只是把它當成一個「一次性問答工具」,那它當然每次都從零開始。但如果你把它當成一個「擁有特定技能的員工」,你就會開始思考:我該如何為這個員工撰寫一份精確的職位描述?
這就是Peter Yang在影片中傳授的第一個核心概念:Claude Skills(技能)。
這不是什麼神秘的工程黑科技,而是一種提示詞的設計哲學。傳統的提示詞像是給AI一張便利貼:「幫我翻譯這段文字。」而一個「技能」則是一份完整的操作手冊,裡面包含了:
- 角色定義:你是誰?你的專業領域是什麼?你的溝通風格如何?
- 核心能力:你擅長處理什麼類型的任務?你的輸出格式是什麼?
- 行為邊界:什麼事你絕對不能做?當遇到模糊指令時,你的預設反應是什麼?
- 知識庫連結:你的專業知識從哪裡來?你該參考哪些文件?
舉個例子。與其寫「幫我寫一封給客戶的跟進郵件」,不如為Claude建立一個「資深業務跟進專員」的技能。這個技能會告訴它:「你是一位擁有10年SaaS銷售經驗的客戶成功經理。你的郵件語氣必須專業但親切,開頭一定要先感謝客戶過去的支持。你需要參考『產品定價表』和『常見客戶反對意見處理SOP』這兩個文件。你的目標是促成下一次產品演示會議,而不是直接逼單。」
看出差別了嗎?前者是命令,後者是賦能。當你把Claude當成一個有血有肉的專業人士來訓練時,它的輸出品質會產生質的飛躍。
為什麼這點至關重要? 因為這代表你不再需要為每個任務手寫落落長的提示詞。你可以將這些「技能」打包、儲存、重複使用。當你需要處理不同類型的任務時,只需切換Claude的「技能」即可,就像為不同工作需求更換專屬工具箱。
讓AI「知道自己不知道」:Evals是你最需要的績效考核
好,現在你給了Claude一份精美的職位描述。它看起來很專業,但問題來了:你怎麼知道它真的有照著做?你怎麼知道它沒有在胡說八道?
這就是第二個核心概念登場的時候:Evals(評估)。
Peter Yang在影片中把Evals形容為AI的「自動化單元測試」。但我想用一個更貼切的比喻:Evals就是AI的績效考核。
想像一下,你是一家公司的老闆。你給員工寫了一份超詳細的SOP,然後就放飛自我,讓他自由發揮。三個月後,你發現客戶投訴變多了,但你不確定問題出在哪裡。是員工沒讀SOP?還是SOP本身有問題?還是客戶的要求變了?
你無從得知,因為你沒有任何數據。
Evals就是來解決這個問題的。它是一套自動化的評估流程,會根據你預先定義好的標準,去測試Claude的表現。這個標準可以是:
- 正確性:Claude的答案是否基於事實?有沒有出現幻覺(Hallucination)?
- 完整性:Claude是否涵蓋了你要求的所有重點?
- 格式一致性:Claude的輸出是否符合你指定的JSON或Markdown格式?
- 語氣合規性:Claude的語氣是否過於生硬或過於隨便?
實戰案例: 假設你建立了一個「技術客服」技能。你可以設計一個Evals,裡面包含10個常見的客戶問題。然後,讓Claude逐一回答。系統會自動檢查:
- Claude的答案是否引用了正確的知識庫文件?
- 它的回答是否在200字以內?(你設定的規則)
- 它是否在最後提供了「是否需要轉接資深工程師」的選項?(你要求的SOP步驟)
如果Claude在「引用正確文件」這項的得分只有60%,你就知道問題出在哪裡了。可能是你的知識庫文件標題太模糊,導致Claude找錯資料;也可能是你的提示詞沒有明確要求它必須引用文件。
Evals的魔力在於,它把AI的表現從「感覺」變成了「數字」。 你再也不用猜測Claude今天心情好不好、有沒有認真工作。你只需要看報表。分數高,代表系統穩定;分數低,代表你需要調整技能或知識庫。
這對於任何一個認真看待AI生產力的人來說,都是不可或缺的。沒有Evals,你就像在黑暗中開車,沒有儀表板,沒有導航,只能憑感覺前進。
終結「金魚腦」:Memory讓Claude擁有你的公司DNA
好了,我們解決了「技能」和「考核」的問題。但還有一個最惱人的痛點:記憶。
你花了半小時跟Claude討論一個專案的來龍去脈,它給出了完美的策略。但你關掉視窗、隔天再打開,它又問你:「這個專案的目標是什麼?」你的血壓瞬間飆升。
這就是所謂的「金魚腦」問題。但Peter Yang在影片中展示的解決方案,並不是什麼神奇的「無限上下文」技術,而是一個更務實、更強大的概念:Memory(記憶)。
別誤會,這裡的Memory不是指Claude會記得你昨天晚餐吃了什麼。而是指一個結構化的、可持續更新的知識庫。
想像一下,你為Claude建立了一個「專屬資料庫」。這個資料庫裡存放的不是一次性文件,而是經過提煉的、關於你、你的團隊、你的專案、你的公司的核心資訊。例如:
- 使用者偏好:用戶喜歡簡潔的答案還是詳細的報告?用戶的專業背景是什麼?
- 專案狀態:目前專案進行到哪個階段?主要的瓶頸是什麼?上次會議的決議是什麼?
- 公司術語:「Q3目標」指的是什麼?「Alpha版本」的定義是什麼?
- 過往決策記錄:為什麼我們選擇了A方案而不是B方案?
這個Memory不是靠Claude自己「記住」的,而是由你(或自動化流程)主動寫入的。每次對話結束後,系統會自動摘要本次對話的關鍵決策和資訊,並更新到Memory中。下一次對話開始時,Claude會先讀取Memory,然後才開始回答問題。
這背後的哲學是什麼? 是「不要把AI當成一個有記憶的神,而要把它當成一個有檔案櫃的員工」。它不需要記住所有事情,但它知道去哪裡找答案。
這種設計的好處是巨大的:
- 上下文無限:理論上,你的Memory可以無限增長,因為它不受單次對話的Token限制。它就像一本不斷增長的百科全書。
- 團隊共享:如果一個團隊共同使用同一個Claude實例,Memory可以成為團隊的「共同大腦」。新人加入時,不需要從頭開始交接,Claude已經具備了團隊的所有知識。
- 持續進化:隨著你跟Claude的互動越來越多,Memory會越來越豐富。Claude對你的了解會越來越深,它的回應也會越來越個人化、越來越精準。
一個具體的應用場景: 你是一個獨立開發者,正在開發一個App。你可以為Claude建立一個Memory,裡面記錄了:
- 你的程式碼風格偏好(使用TypeScript、函數式編程)。
- 你目前正在解決的Bug(#42:登入頁面在Safari上會崩潰)。
- 你的API金鑰存放位置(環境變數)。
- 你對UI的審美偏好(極簡風格、使用Tailwind CSS)。
當你下次打開Claude,說:「幫我看看這個登入頁面的程式碼。」Claude會直接說:「好的,我注意到你正在處理Bug #42,我已經讀取了你之前寫的登入元件。我發現問題出在Safari對WebAuthn API的支援度不足,建議你改用另一種驗證方式,並參考我放在Memory中的Fallback方案。」
這已經不是一個聊天機器人了。這是一個真正了解你、知道你正在做什麼、並且能提供上下文感知建議的開發夥伴。
技能、評估、記憶:如何打造你的AI員工鐵三角?
現在,我們已經掌握了三個核心武器:Skills(技能)、Evals(評估)、Memory(記憶)。但關鍵在於,如何讓它們協同作戰?
Peter Yang在影片中展示了一套完整的工作流,我將其總結為一個「AI員工管理閉環」:
- 定義技能(Onboarding):為你的AI員工撰寫詳細的職位描述。告訴它它是誰、該做什麼、不該做什麼。
- 注入記憶(Knowledge Base):將公司背景、專案狀態、使用者偏好等結構化資訊寫入Memory。這是AI的「長期記憶」和「公司DNA」。
- 執行任務(Work):讓AI開始工作。它會根據技能定義和記憶庫來執行任務。
- 評估表現(Review):透過Evals進行自動化績效考核。檢查AI的輸出是否合規、是否準確、是否偏離了技能定義。
- 迭代優化(Iterate):根據Evals的結果,調整技能提示詞、更新記憶庫、或修正Evals的評估標準。然後回到步驟3,形成一個持續優化的循環。
這個閉環的威力在於,它把AI從一個「靜態工具」變成了一個「動態系統」。它會隨著你的使用而變得越來越聰明、越來越可靠。你不再需要手動「調教」它,因為系統本身就在進行自我校準。
核心觀點速覽:你該帶走的三個層次
為了讓你更清楚地掌握這套系統的架構,我整理了一個對照表,幫助你理解從「傳統用法」到「技能系統」的進化路徑。
| 面向 | 傳統的「聊天機器人」用法 | 進階的「AI員工」技能系統 |
|---|---|---|
| 核心概念 | 一次性問答,每次從零開始 | 具備角色、知識、行為邊界的專業技能 |
| 記憶機制 | 仰賴對話歷史(Token限制,易遺忘) | 結構化記憶庫(Memory),可持續更新與查詢 |
| 品質控制 | 人工檢查,憑感覺判斷 | 自動化評估(Evals),數據驅動的績效考核 |
| 迭代方式 | 手動修改提示詞,無反饋閉環 | 評估結果驅動技能與記憶庫優化,形成自動化閉環 |
| 適用場景 | 簡單問答、翻譯、摘要 | 複雜任務、長期專案、客服機器人、個人AI助理 |
| 最終效果 | 穩定但平庸,每次表現不一 | 持續進化,愈用愈聰明,輸出品質可量化 |
這個表格清楚地說明了,為什麼你必須從「使用AI」進化到「管理AI」。前者只是工具,後者才是生產力引擎。
結語:你準備好當AI經理了嗎?
回到最開始的問題:為什麼你的Claude總是笨笨的?
因為你只給了它一個對話框,卻沒有給它一個「職場」。你沒有告訴它它的職位是什麼,沒有給它員工手冊,沒有進行績效考核,更沒有建立它的個人檔案。
現在,你有了這套「技能、評估、記憶」的鐵三角。你不再只是一個AI用戶,你是一個AI經理。你的工作不再是「打字問問題」,而是「設計系統、定義標準、迭代優化」。
這才是AI時代真正的生產力密碼。
當你下次打開Claude時,先問自己一個問題:我今天是來「問問題」的,還是來「訓練員工」的?
如果你的答案是後者,那麼恭喜你,你已經領先了99%的人。而你的Claude,也將從一個「金魚腦」進化成一個無可取代的「超級員工」。
現在,去建立你的第一個「技能」吧。