基礎 LLMs 與 AI Agent
IT Standard 14 10 hrs AI Python
本課程介紹大型語言模型的工作原理,以及如何將該模型轉化為能夠在電腦上執行操作的 agent。學生將首先透過詞元化、嵌入、注意力機制及下一個詞預測來追蹤提示詞的處理過程,然後在 Google Gemini 中練習良好提示詞的五個要素,並透過一次對話產生重點內容、一幅 AI 生成漫畫以及一個使用 Canvas 工具構建的應用程式。除了實作外,學生還會探討幻覺、訓練數據截止及記憶體上限,應用「信任但須驗證」常規,並審視何謂網上敏感資訊。課程的後半部將轉離雲端:學生將安裝 Ollama,在本地運行開源模型,同時記錄 CPU 使用率、記憶體及 token 吞吐量,並比較不同的模型大小。然後,他們將在 Thonny 中運行提供的 Python agents,以在受限的沙盒資料夾內重新命名、建立、讀取及刪除檔案,觀察 Think-Act-Observe 循環,並為 agent 增加新工具。課程最後將介紹基於技能的個人助理,學生將從範本中編寫自己的 Python 技能,並將其載入至助理的技能組中。
學習目標
- 解釋大型語言模型如何生成文字,涵蓋詞元化、嵌入、注意力機制及下一個詞預測。
- 編寫結構化提示詞,並針對幻覺、知識截止、記憶體限制及網上私隱風險評估 LLM 的輸出。
- 使用 Ollama 在本地運行開源模型,並使用 Python 構建沙盒檔案 agent 及基於技能的助理。
課程大綱
探索 AI 與 LLM | 描述人工智能、機器學習、深度學習及 transformer 模型之間的關係,並解釋 LLM 如何透過詞元化、嵌入、注意力機制及下一個詞預測來構建答案
提示詞、限制與網上私隱 | 應用良好提示詞的五個要素(角色、目標、受眾、背景、界限)及大師級提示策略;識別幻覺、訓練數據截止及記憶體上限;應用「信任但須驗證」規則並比較常見 LLM 服務的優勢;識別敏感個人數據及其在網上分享的風險 | 實作:i) 使用 Google Gemini 就選定主題生成重點內容,並利用後續提示詞進行完善 ii) 要求 LLM 撰寫圖像提示詞,然後生成一幅解釋相同主題的四格漫畫 iii) 使用 Canvas 工具將對話轉化為應用程式
本地電腦上的 LLMs | 比較雲端與本地模型在私隱、連接性及模型大小方面的差異,並安裝及使用 Ollama 運行開源模型 | 實作:i) 記錄載入模型前後的 CPU 使用率及總 RAM ii) 使用 --verbose 運行 gemma4:e2b 及 deepseek-r1:8b,並以每秒 token 數量為單位記錄提示詞與回應速度 iii) 比較兩個模型,並討論較大的參數數量是否總是能帶來更好的結果
AI agent 實驗 | 區分聊天機械人與 agent,介紹指令與簡單腳本,解釋 Think-Act-Observe 循環,並解釋為何 agent 會被限制在沙盒資料夾內 | 實作:i) 在 Thonny 運行 agent.py,並要求其重新命名及刪除 AI_Sandbox 資料夾內的檔案 ii) 運行 smart-agent.py,並計算其列出、讀取、建立、重新命名及刪除檔案所需的步驟數量 iii) 嘗試對 AI_Sandbox 外的檔案進行操作以測試資料夾限制 iv) 為 smart-agent.py 增加新工具,使 agent 能夠將文字寫入檔案
個人助理與技能組 | 理解技能組作為賦予 LLM 的操作集合,以及工具列表和系統提示詞如何指示助理在何時使用哪項技能;概述進階 agents 如何透過自行編寫代碼及平行運行子 agents 來擴展此功能 | 實作:i) 運行 assistant.py 並向其查詢當前時間 ii) 從 skill_template.py 構建 get_current_time.py 並將其加入至 Skillset 資料夾 iii) 建立一項額外的個人技能,例如筆記或從開放數據 API 獲取天氣數據
先修課程
- 具備基礎 Python 經驗
硬體需求
- 配備已更新瀏覽器的手提電腦/桌上電腦
- 能夠使用 Ollama 運行本地模型的 Windows 手提電腦/桌上電腦
軟體需求
- Google Gemini
- Ollama
- Thonny
- 已安裝 ollama 套件的 Python