Tóm Tắt Khoa Học (Abstract) Bản Dịch Chuẩn
arXiv:2507.12425v1 [cs.CL]
Các tổ chức ngày càng phụ thuộc vào dữ liệu doanh nghiệp độc quyền — bao gồm hồ sơ nhân sự, báo cáo có cấu trúc và tài liệu dạng bảng — để phục vụ ra quyết định quan trọng. Mặc dù LLM có khả năng tạo sinh mạnh mẽ, chúng vẫn bị hạn chế bởi tiền huấn luyện tĩnh, cửa sổ ngữ cảnh hữu hạn và thách thức khi xử lý dữ liệu không đồng nhất. RAG truyền thống thường tỏ ra kém hiệu quả trên dữ liệu có cấu trúc và bán cấu trúc. Công trình này giới thiệu một khung sườn RAG nâng cao kết hợp truy xuất lai (Dense Embedding all-mpnet-base-v2 + Sparse BM25), lọc nhận biết siêu dữ liệu qua SpaCy NER và tái xếp hạng Cross-Encoder (ms-marco-MiniLM-L-12-v2) nhằm bảo toàn tính toàn vẹn của các mối quan hệ hàng - cột. Kết quả thực nghiệm chứng minh Precision@5 đạt 90% (+15%), Recall@5 đạt 87% (+13%), MRR đạt 0.85 (+16%), và độ trung thực đạt 4.6/5.0.
Bối Cảnh & Các Thách Thức Của RAG Truyền Thống
Tại sao mô hình Naive RAG thất bại khi đối mặt với dữ liệu doanh nghiệp phức hợp?
Phân mảnh Ngữ cảnh (Fragmented Context)
Các chiến lược chia đoạn cố định theo số lượng token (fixed token length) làm cắt đứt các mệnh đề logic, bảng lương hoặc quy trình nhân sự phức tạp, làm mất sự liên kết ngữ nghĩa giữa các câu liền kề.
Phá hủy Cấu trúc Dữ liệu Bảng (Tabular Destruction)
Ép bảng biểu thành văn bản tuyến tính (linear text flattening) triệt tiêu hoàn toàn quan hệ hai chiều hàng - cột. Khi người dùng hỏi về một nhân sự hoặc chỉ số ở một hàng cụ thể, hệ thống truy xuất sai lệch hoặc nhầm dòng.
Ảo giác & Bỏ sót Mã Định Danh (IDs & Hallucination)
Embedding dày đặc (Dense Embeddings) hiểu ngữ nghĩa tốt nhưng rất kém khi tìm từ khóa chính xác (Mã nhân viên, số hiệu chính sách, mã dự án). Ngược lại, BM25 thô sơ thiếu ngữ nghĩa dẫn tới trôi dạt ngữ cảnh và ảo giác.
Kiến Trúc Khung Sườn RAG Nâng Cao (Proposed Architecture)
Sự kết hợp chặt chẽ giữa Tiền xử lý Ngoại tuyến, Lớp Chỉ Mục Kép và Suy Luận Trực Tuyến có Phản Hồi
Sơ Đồ Luồng Dữ Liệu Toàn Cảnh Kết Nối Trực Quan
Quy trình tích hợp khép kín từ nạp dữ liệu thô đến phản hồi người dùng
1. Tiền Xử Lý Ngoại Tuyến
Offline Ingestion & Enrichment
PDF chính sách, sổ tay nhân sự, báo cáo tài chính từ NASSCOM, Data.gov, UCI.
• Bảng biểu: Dùng Camelot trích xuất sang JSON, lập chỉ mục cấp độ hàng.
• Văn bản: Phân đoạn đệ quy tối ưu 2.000 ký tự (overlap 500 ký tự).
Trích xuất phòng ban, mã dự án, thời gian, nhãn bảo mật để làm giàu siêu dữ liệu lọc.
Mô hình all-mpnet-base-v2 sinh vector 768 chiều cho từng hàng dữ liệu và đoạn văn.
Trụ Cột Lưu Trữ Kép
Dual Index Storage Core
Cấu trúc đồ thị HNSW Graph ($M=32, ef=200$). Tìm kiếm ngữ nghĩa sâu, phát hiện tài liệu đồng nghĩa và liên quan gián tiếp.
Bảng chỉ mục ngược khớp từ khóa chính xác: mã định danh nhân sự (ID), số hiệu quy chế, mã hợp đồng và tên món ăn.
2. Suy Luận & Tác Tử
Online Inference & Agentic Loop
Tiếp nhận truy vấn người dùng kết hợp bộ nhớ đệm 10 lượt hội thoại gần nhất.
Truy vấn đồng thời FAISS + BM25: Score = 0.6·Dense + 0.4·Sparse.
Dùng ms-marco-MiniLM-L-12-v2 chấm điểm chéo theo cặp, nâng MRR lên 0.85.
LLM (Mistral/LLaMA) chỉ trả lời dựa trên tài liệu truy xuất, đạt độ trung thực 4.6/5.0.
Nếu nhận phản hồi chưa hài lòng, hệ thống tự động viết lại & mở rộng câu hỏi để truy xuất lại.
6 Trọng Tâm Đổi Mới Kỹ Thuật (Key Innovations)
Các cải tiến cụ thể tạo nên bước nhảy vọt hiệu năng
Lập Chỉ Mục Cấp Độ Hàng (Row-Level Indexing)
Không gộp cả bảng vào 1 chunk. Khung sườn dùng Camelot trích xuất sang JSON, sau đó tách từng hàng thành một bản ghi riêng biệt có gắn kèm tên tệp, tên cột và tiêu đề. Nhờ đó, các truy vấn tra cứu từng nhân viên hay từng dòng ngân sách đạt độ chuẩn xác tuyệt đối.
Camelot + pdfplumber
Độ mịn cao
Phân Đoạn Ngữ Nghĩa & spaCy NER
Văn bản được phân đoạn đệ quy theo ngữ nghĩa với độ dài tối ưu 2.000 ký tự (overlap 500 ký tự). Mỗi đoạn được quét qua spaCy NER để làm giàu siêu dữ liệu: nhận diện thực thể (địa điểm, ngày tháng, tổ chức), phòng ban và cấp độ bảo mật.
spaCy
Bảo toàn ngữ cảnh
Truy Xuất Lai Dung Hợp Trọng Số
Khắc phục nhược điểm của việc chỉ dùng 1 phương pháp. Điểm tổng hợp được tối ưu hóa qua thực nghiệm:
Score = 0.6 × Dense + 0.4 × BM25
Tận dụng sức mạnh hiểu ngữ nghĩa của all-mpnet-base-v2 và khả năng bắt đúng từ khóa của BM25.
M=32, ef=200
Chuẩn xác 90%
Tái Xếp Hạng Bằng Cross-Encoder
Bi-encoder (Dense embedding) tính điểm cosine độc lập nên có thể lọt tài liệu nhiễu. Hệ thống đưa Top-K ứng viên qua bộ Cross-Encoder (ms-marco-MiniLM-L-12-v2) để phân tích độ tương tác sâu chéo giữa câu hỏi và đoạn trích, đẩy tài liệu liên quan nhất lên đầu.
MiniLM-L-12-v2
MRR đạt 0.85
Tinh Chỉnh Truy Vấn & Vòng Lặp Phản Hồi
Tích hợp cơ chế viết lại (Query Rewriting) và mở rộng truy vấn (Query Expansion) bằng LLM. Khi người dùng đánh giá tiêu cực (👎), hệ thống không giữ nguyên kết quả cũ mà tự động kích hoạt LLM phân tích lại ý định, sinh truy vấn bổ trợ và thực hiện truy xuất lại.
Chỉ Mục Kép (Dual Index) & Prompt Tiếp Đất
Thiết kế hai chỉ mục song song: Chỉ mục chính xác cao (all-mpnet-base-v2) cho server mạnh và Chỉ mục siêu nhẹ (paraphrase-MiniLM-L3-v2) cho thiết bị hạn chế tài nguyên. Kèm theo mẫu câu nhắc bắt buộc trích dẫn nguồn và tóm tắt nếu câu dài hơn 3 dòng.
Kết Quả Đánh Giá Thực Nghiệm Đối Đầu
So sánh Direct LLM Prompting, Naive RAG và Advanced RAG trên tập dữ liệu doanh nghiệp
| Thước Đo Đánh Giá (Evaluation Metric) | Direct LLM (Chỉ Prompting) | Naive RAG (Baseline) | Advanced RAG (Đề Xuất) | Mức Độ Cải Thiện |
|---|---|---|---|---|
|
Precision@5
Tỷ lệ tài liệu hữu ích trong top 5 kết quả
|
62% | 75% | 90% | +15% (vs Naive) |
|
Recall@5
Độ bao phủ toàn bộ tài liệu liên quan
|
58% | 74% | 87% | +13% (vs Naive) |
|
Mean Reciprocal Rank (MRR)
Vị trí thứ hạng của kết quả đúng đầu tiên
|
0.60 | 0.69 | 0.85 | +16% (vs Naive) |
|
Tính Trung Thực (Faithfulness)
Mức độ bám sát tài liệu nguồn, không bịa đặt (thang 5)
|
2.8 / 5.0 | 3.0 / 5.0 | 4.6 / 5.0 | +53.3% chất lượng |
|
Độ Hoàn Thiện (Completeness)
Mức độ trả lời đầy đủ các vế câu hỏi (thang 5)
|
2.3 / 5.0 | 2.5 / 5.0 | 4.2 / 5.0 | +68.0% độ sâu |
|
Độ Liên Quan (Relevance)
Tính trúng đích và hữu ích trực tiếp của câu trả lời (thang 5)
|
2.9 / 5.0 | 3.2 / 5.0 | 4.5 / 5.0 | +40.6% chuẩn xác |
So Sánh Thước Đo Định Lượng (%)
Đánh Giá Định Tính Bởi Chuyên Viên (Thang điểm 5)
Hạn Chế Hiện Tại & Hướng Mở Rộng Tương Lai
Những thách thức cần tháo gỡ để thương mại hóa toàn diện
- • Lập chỉ mục tĩnh (Static Indexing): Mỗi khi kho tài liệu cập nhật chính sách mới cần tái lập chỉ mục toàn bộ (full reindexing), chưa hỗ trợ cơ chế nạp gia tăng thời gian thực.
- • Bảng lồng nhau phức tạp (Nested / Merged Cells): Vẫn gặp hạn chế khi phân tích bảng có nhiều cấp tiêu đề lồng nhau hoặc các ô bị gộp (merged cells).
- • Phụ thuộc phản hồi tường minh: Chỉ tối ưu truy vấn khi người dùng bấm thích/không thích. Cần khai thác thêm tín hiệu tương tác ngầm (thời gian đọc, click).
- • Độ trễ dung hợp khi dữ liệu khổng lồ: Quá trình dung hợp Dense + Sparse và Reranking với hàng triệu bản ghi sẽ gây áp lực lớn về độ trễ tính toán.
- • Hệ thống RAG Mang Tính Tác Tử (Agentic RAG): Tích hợp các Agent tự chủ (ReAct / Reflexion) có khả năng tự suy luận, chủ động chọn chiến lược truy xuất động theo từng tình huống.
- • Mở rộng Đa Phương Thức (Multimodal Data): Tiếp nhận tài liệu quét (scanned PDFs), sơ đồ kiến trúc doanh nghiệp, đồ thị báo cáo tài chính và biểu đồ kỹ thuật.
-
•
Mô hình Hiểu Bảng Chuyên Sâu: Tích hợp mô hình tiền huấn luyện sâu dạng bảng như
TAPAShoặcTURLđể xử lý các bảng lồng ghép phức tạp. - • Lập chỉ mục động gia tăng (Dynamic Indexing): Tự động bổ sung tài liệu mới vào FAISS HNSW mà không cần dừng hệ thống.
Tổng Kết & Đóng Góp Tri Thức Cho Dự Án SmartRestaurant
Bài báo cung cấp giải pháp mẫu hoàn hảo cho hệ thống SmartRestaurant: Giải quyết bài toán dữ liệu thực đơn có giá, nguyên liệu, bảng công thức món ăn (dữ liệu có cấu trúc dạng bảng) kết hợp với các bài viết giới thiệu ẩm thực và đánh giá của khách hàng (dữ liệu phi cấu trúc) bằng cơ chế Truy xuất Lai (Hybrid Retrieval) và Lập chỉ mục cấp độ hàng (Row-level Indexing).