嵌入向量與向量資料庫(Embedding & Vector Database)是什麼?
嵌入向量是把文字、圖片等內容轉成一串浮點數,使意思相近的內容在數學空間中距離也相近。2013 年 Mikolov 等人提出的 Word2Vec 讓這種做法普及。向量資料庫則用來快速搜尋大量向量,是 RAG 常用的元件。
模型技術EmbeddingEmbeddings嵌入向量嵌入向量資料庫Vector Database
一句話說明
把文字等內容轉成一串數字(向量),讓電腦能計算「意思有多接近」;向量資料庫則專門儲存與搜尋這些向量。
嵌入向量與向量資料庫怎麼運作?
- 用嵌入模型把每段文字轉成固定長度的數字向量。
- 把向量連同原文存進向量資料庫。
- 查詢時,把問題也轉成向量。
- 計算距離,找出最接近(意思最相關)的內容回傳。
實際例子
- 搜尋「怎麼退貨」,也能找到寫著「退換貨流程」的文件。
- 依文章內容相似度推薦相關文章。
- 把客訴自動分群,找出常見問題類型。
常見誤解
誤解:向量搜尋就是關鍵字搜尋。
事實:關鍵字搜尋比對字面;向量搜尋比對意思,即使用字不同也能找到相關內容。
事實:關鍵字搜尋比對字面;向量搜尋比對意思,即使用字不同也能找到相關內容。
誤解:沒有向量資料庫就不能用嵌入向量。
事實:資料量小時可以直接在程式裡計算距離;資料量大、需要快速搜尋時才特別需要向量資料庫。
事實:資料量小時可以直接在程式裡計算距離;資料量大、需要快速搜尋時才特別需要向量資料庫。
常見問題
嵌入向量可以用在哪些地方?
OpenAI 文件列出的常見用途包括:語意搜尋、分群、推薦、異常偵測、多樣性分析與分類。在 AI 應用中最常見的是搭配 RAG,替模型找出相關資料。
向量之間的「距離」代表什麼意思?
距離代表兩段內容的相關程度:距離越小,意思越接近;距離越大,關聯越低。常用的計算方式有餘弦相似度等。
相關名詞
參考來源
- OpenAI API 文件:Vector embeddings
- Mikolov et al., Efficient Estimation of Word Representations in Vector Space(arXiv 1301.3781)
查核日期:2026-09-26。API:/api/term?id=embedding