Nhiệm vụ: Nghiên cứu lý thuyết về bộ tách mã thông báo (tokenizer), mã thông báo (token) và vector của LLM
Nghiên cứu lý thuyết về bộ tách mã thông báo (tokenizer), mã thông báo (token) và vector của LLM
Tôi chợt nảy ra ý tưởng rằng mặc dù các từ không thể được chuyển đổi trực tiếp thành ý nghĩa và các vùng trong không gian vector, nhưng có vẻ vẫn có một manh mối nào đó. Nếu tin vào nghiên cứu sơ lược rằng bộ tách mã thông báo sẽ luôn dịch cùng một văn bản thành cùng một tập hợp các vector. Và mặc dù chúng ta không thể tự mình áp dụng một số lượng lớn các vector để nhanh chóng hiểu văn bản một cách chi tiết, tôi nghĩ rằng cơ chế này có thể được sử dụng để hiểu chung khá nhanh các tin nhắn đến. Tức là, có thể hiểu đại khái đó là Câu hỏi hay Khẳng định, những đối tượng nào được đề cập trong tin nhắn, v.v. (tức là Xe buýt, Ô tô, Xe máy phải ở gần nhau đâu đó trong không gian vector). Chúng ta có thể chuẩn bị một tập hợp các văn bản (bao gồm cả câu hỏi và câu trả lời) và thử so sánh trực quan các tập hợp vector thu được (chỉ cần sắp xếp chúng theo chiều dọc thành một cột và thêm các biểu đồ giúp phóng đại trực quan các giá trị lệch nhiều nhất).
Nếu kết quả khả quan, ít nhất điều này có thể được sử dụng để chuẩn bị dữ liệu sơ bộ nhanh chóng và tạo hướng dẫn cho tác nhân AI, cũng như để thực hiện bắt buộc các hành động chuyên môn.