認識生成式 AI 與 Gemini 模型家族
核心問題:生成式 AI 是怎麼運作的?Gemini 模型家族有哪些成員、各自擅長什麼?
Gemini 是 Google 的多模態模型家族,同一組模型驅動了五個定位不同的產品介面。本章先建立語言模型的基本心智模型——它是機率式的文字生成器,不是資料庫,會產生幻覺、有脈絡窗口限制——再介紹 Gemini 家族的分工:Pro 系列處理複雜推理、Flash 系列追求速度與成本效率、Nano Banana 系列專司圖像生成。搞清楚「模型」與「產品」的差別,是理解整個生態系的第一步。
學習成果:能用正確的心智模型理解語言模型的能與不能,並分辨 Gemini 各模型與各產品的關係。
核心概念
語言模型是機率生成器
大型語言模型根據上文預測下一個最可能的字詞,它不查資料庫、不真正「知道」事實。這解釋了為什麼它可以流暢地寫出錯誤的內容(幻覺),也解釋了為什麼給它的脈絡越完整、輸出越可靠。
說人話:把它想成一位讀過海量文章的接話高手:接得很順,但順不等於對。
多模態(Multimodal)
Gemini 原生支援文字、圖片、音訊、影片輸入。教學上的意義:你可以直接丟一張學生作業照片、一段教學影片或一份 PDF 給它,不需要先自己轉成文字。
脈絡窗口(Context Window)
模型單次能「看見」的內容量有上限。超過上限的內容它就看不到——這是 NotebookLM 這類來源導向工具存在的理由之一:用檢索的方式讓模型每次只讀取最相關的來源片段。
說人話:像一張桌面:桌面再大也放不下整座圖書館,所以需要一位館員(檢索系統)幫你把相關的書搬上桌。
模型家族分工
Gemini Pro 系列負責複雜推理與長文件、Flash 系列追求速度與高頻使用、Nano Banana 系列(Gemini 影像模型)專司圖像生成與編輯。各產品介面會依情境調用不同模型,多數時候你不需要手動選。
「模型」與「產品」是兩回事
教育現場最常見的混淆是把 Gemini 當成單一 App。實際上 Gemini 模型同時驅動:Gemini 應用程式(gemini.google.com)、NotebookLM、Antigravity、Workspace Studio、Gemini in Classroom,以及 Chrome 內建的 Gemini 側欄。同一個模型在不同介面裡,資料範圍、記憶方式、輸出型態完全不同。
- 在 Gemini 應用程式問「幫我摘要這份教材」→ 它只看你貼上的內容
- 在 NotebookLM 問同一句 → 它檢索你匯入的來源並附出處
- 在 Workspace Studio 設定同樣的需求 → 它變成事件觸發的自動化流程
- 判斷「該去哪裡問」比「怎麼問」更基本——這是本手冊五介面架構的理由
幻覺:教育工作者的第一風險
模型會自信地生成看似合理但錯誤的內容。教學素材的事實錯誤會直接影響學生,所以任何要進課堂的 AI 產出都需要人工查證。降低幻覺的三個實用策略:
- 給來源:把正確資料放進脈絡(貼原文、匯入 NotebookLM),而不是讓模型憑記憶回答
- 要出處:要求「標注這段話依據哪份來源」,NotebookLM 原生做到這件事
- 設邊界:在提示詞明確要求「資料不足時說不知道,不要編造」
常見誤解
誤解:Gemini 就是一個聊天機器人。
實際:聊天只是其中一個介面。同一組模型還以知識庫(NotebookLM)、自動化(Workspace Studio)、開發代理(Antigravity)、課堂工具(Classroom)的形態存在。
誤解:AI 回答得很流暢,代表內容正確。
實際:流暢是語言模型的本質能力,正確不是。教學素材永遠需要教師做最後的事實查核。