OpenAI
Trang này được dịch bằng máy học. Xem bài viết gốc bằng tiếng Anh.

Câu hỏi thường gặp về Embeddings

Câu hỏi thường gặp về các mô hình embedding mới và cải tiến

Đã cập nhật: 5 days ago

Ngày 25 tháng 1 năm 2024, chúng tôi đã phát hành hai mô hình embedding mới: text-embedding-3-smalltext-embedding-3-large. Đây là những mô hình embedding mới nhất và có hiệu năng cao nhất của chúng tôi, với chi phí thấp hơn, hiệu năng đa ngôn ngữ tốt hơn cùng một tham số mới để rút gọn embedding. Tìm hiểu thêm.

Có gì khác biệt ở các mô hình embedding mới nhất?

Các mô hình v3 mới nhất của chúng tôi mang lại hiệu năng mạnh hơn trên các benchmark phổ biến với mức giá thấp hơn. Bạn có thể đọc thêm về các cải tiến hiệu năng trong bài đăng blog công bốtài liệu dành cho nhà phát triển.

Làm cách nào để biết một chuỗi sẽ có bao nhiêu token trước khi tôi thử nhúng chuỗi đó?

Bạn có thể dùng gói Tiktoken của OpenAI để kiểm tra một chuỗi sẽ có bao nhiêu token. Tìm hiểu thêm trong hướng dẫn dành cho nhà phát triển về embedding của chúng tôi.

Làm cách nào để truy xuất nhanh K vector embedding gần nhất?

Để tìm kiếm nhanh trong nhiều vector, chúng tôi khuyên bạn nên dùng cơ sở dữ liệu vector.

Tôi nên dùng hàm khoảng cách nào?

Các đầu ra embedding của API OpenAI được chuẩn hóa L2 về độ dài 1 theo mặc định, kể cả sau khi rút ngắn bằng tham số dimensions, nghĩa là:

Các embedding của OpenAI được chuẩn hóa về độ dài 1, nghĩa là:

  • Độ tương đồng cosine có thể được tính nhanh hơn đôi chút chỉ bằng tích vô hướng

  • Độ tương đồng cosine và khoảng cách Euclid sẽ cho ra thứ hạng giống hệt nhau

Bài viết này có hữu ích không?