Báo Cáo Nghiên Cứu Khoa Học

Advancing RAG for Structured Enterprise Data

arXiv:2507.12425v1 Mục Lục
Tóm tắt toàn diện và trực quan hóa chuyên sâu

Phát Triển Sinh Tăng Cường Truy Xuất Cho Dữ Liệu Doanh Nghiệp Có Cấu Trúc

Chandana Cheerla • Viện Công Nghệ IIT Roorkee, Ấn Độ • Email: chandana_c@mfs.iitr.ac.in

Precision@5
90%
+15% so với Naive RAG (75%)
Recall@5
87%
+13% so với Naive RAG (74%)
Mean Reciprocal Rank (MRR)
0.85
+16% so với Naive RAG (0.69)
Tính Trung Thực (Faithfulness)
4.6/5.0
Vượt trội Naive RAG (3.0)
Điều Hướng Nhanh (Mục Lục):

Tóm Tắt Khoa Học (Abstract) Bản Dịch Chuẩn

arXiv:2507.12425v1 [cs.CL]

Các tổ chức ngày càng phụ thuộc vào dữ liệu doanh nghiệp độc quyền — bao gồm hồ sơ nhân sự, báo cáo có cấu trúc và tài liệu dạng bảng — để phục vụ ra quyết định quan trọng. Mặc dù LLM có khả năng tạo sinh mạnh mẽ, chúng vẫn bị hạn chế bởi tiền huấn luyện tĩnh, cửa sổ ngữ cảnh hữu hạn và thách thức khi xử lý dữ liệu không đồng nhất. RAG truyền thống thường tỏ ra kém hiệu quả trên dữ liệu có cấu trúc và bán cấu trúc. Công trình này giới thiệu một khung sườn RAG nâng cao kết hợp truy xuất lai (Dense Embedding all-mpnet-base-v2 + Sparse BM25), lọc nhận biết siêu dữ liệu qua SpaCy NER và tái xếp hạng Cross-Encoder (ms-marco-MiniLM-L-12-v2) nhằm bảo toàn tính toàn vẹn của các mối quan hệ hàng - cột. Kết quả thực nghiệm chứng minh Precision@5 đạt 90% (+15%), Recall@5 đạt 87% (+13%), MRR đạt 0.85 (+16%), và độ trung thực đạt 4.6/5.0.

Từ khóa cốt lõi: Hybrid RAG Row-Level Indexing Dense + BM25 Cross-Encoder Reranking Strict Grounding
01

Bối Cảnh & Các Thách Thức Của RAG Truyền Thống

Tại sao mô hình Naive RAG thất bại khi đối mặt với dữ liệu doanh nghiệp phức hợp?

Phân mảnh Ngữ cảnh (Fragmented Context)

Các chiến lược chia đoạn cố định theo số lượng token (fixed token length) làm cắt đứt các mệnh đề logic, bảng lương hoặc quy trình nhân sự phức tạp, làm mất sự liên kết ngữ nghĩa giữa các câu liền kề.

Phá hủy Cấu trúc Dữ liệu Bảng (Tabular Destruction)

Ép bảng biểu thành văn bản tuyến tính (linear text flattening) triệt tiêu hoàn toàn quan hệ hai chiều hàng - cột. Khi người dùng hỏi về một nhân sự hoặc chỉ số ở một hàng cụ thể, hệ thống truy xuất sai lệch hoặc nhầm dòng.

Ảo giác & Bỏ sót Mã Định Danh (IDs & Hallucination)

Embedding dày đặc (Dense Embeddings) hiểu ngữ nghĩa tốt nhưng rất kém khi tìm từ khóa chính xác (Mã nhân viên, số hiệu chính sách, mã dự án). Ngược lại, BM25 thô sơ thiếu ngữ nghĩa dẫn tới trôi dạt ngữ cảnh và ảo giác.

02

Kiến Trúc Khung Sườn RAG Nâng Cao (Proposed Architecture)

Sự kết hợp chặt chẽ giữa Tiền xử lý Ngoại tuyến, Lớp Chỉ Mục Kép và Suy Luận Trực Tuyến có Phản Hồi

💡
Logic vận hành của kiến trúc: Hệ thống gồm 2 luồng công việc được kết nối thông qua Lớp Lưu Trữ Chỉ Mục Kép (Dual Index Storage Core) ở vị trí trung tâm. Toàn bộ tài liệu và bảng biểu doanh nghiệp được xử lý ngoại tuyến (Row-Level chunking + spaCy NER + all-mpnet-base-v2) để nạp đồng bộ vào FAISS và BM25. Khi người dùng đặt câu hỏi trực tuyến, bộ điều phối kích hoạt truy xuất lai đồng thời, tái xếp hạng Cross-Encoder để lọc top kết quả chuẩn xác nhất, đưa vào LLM tạo sinh có neo dữ liệu (Strict Grounding) và tự thích ứng bằng cơ chế mở rộng truy vấn khi nhận phản hồi chưa hài lòng.

Sơ Đồ Luồng Dữ Liệu Toàn Cảnh Kết Nối Trực Quan

Quy trình tích hợp khép kín từ nạp dữ liệu thô đến phản hồi người dùng

Offline Ingestion Dual Index Core Online Inference
flowchart TD subgraph G1 ["1. TIỀN XỬ LÝ NGOẠI TUYẾN (OFFLINE)"] direction TB DOC["Tài Liệu Doanh Nghiệp (PDF, Bảng biểu)"] CHUNK["Phân Đoạn Kép (Camelot Table + Text 2k)"] NER["Trích Xuất Thực Thể (spaCy NER)"] EMBED["Mô Hình Nhúng (all-mpnet-base-v2)"] DOC --> CHUNK --> NER --> EMBED end subgraph G2 ["TRỤ CỘT CHỈ MỤC KÉP (DUAL STORAGE CORE)"] direction TB FAISS[("FAISS Vector DB (Dense HNSW M=32)")] BM25[("BM25 Inverted Index (Sparse Keyword)")] end subgraph G3 ["2. SUY LUẬN TRỰC TUYẾN (ONLINE INFERENCE)"] direction TB USER["Người Dùng Đặt Câu Hỏi"] HYBRID["Truy Xuất Lai (0.6*Dense + 0.4*Sparse)"] RERANK["Tái Xếp Hạng Chéo (MiniLM Reranker)"] LLM["LLM Tạo Sinh Tiếp Đất Chặt Chẽ (Strict Grounding)"] RES["Phản Hồi Chuẩn Xác 90% (MRR 0.85)"] USER --> HYBRID --> RERANK --> LLM --> RES end EMBED -->|"Nạp Dense Vector"| FAISS CHUNK -->|"Nạp Từ Khóa Cột/Hàng"| BM25 FAISS -->|"Khớp Ngữ Nghĩa Sâu"| HYBRID BM25 -->|"Khớp Từ Khóa Chính Xác"| HYBRID RES -.->|"Phản hồi chưa hài lòng"| REWRITE["Tự Động Viết Lại & Mở Rộng Truy Vấn"] REWRITE -.->|"Truy vấn tái cấu trúc"| HYBRID classDef offBox fill:#eff6ff,stroke:#3b82f6,stroke-width:1.5px,color:#1e3a8a,font-size:12px; classDef storeBox fill:#fef3c7,stroke:#f59e0b,stroke-width:2px,color:#78350f,font-size:12px; classDef onBox fill:#ecfdf5,stroke:#10b981,stroke-width:1.5px,color:#064e3b,font-size:12px; classDef loopBox fill:#fdf4ff,stroke:#d946ef,stroke-width:1.5px,color:#701a75,font-size:12px; class G1 offBox; class G2 storeBox; class G3 onBox; class REWRITE loopBox;
📥

1. Tiền Xử Lý Ngoại Tuyến

Offline Ingestion & Enrichment

Chạy trước
BƯỚC 1: Nạp Tài Liệu Thô

PDF chính sách, sổ tay nhân sự, báo cáo tài chính từ NASSCOM, Data.gov, UCI.

BƯỚC 2: Phân Đoạn Kép (Dual Chunking)

• Bảng biểu: Dùng Camelot trích xuất sang JSON, lập chỉ mục cấp độ hàng.
• Văn bản: Phân đoạn đệ quy tối ưu 2.000 ký tự (overlap 500 ký tự).

BƯỚC 3: Gắn Nhãn Thực Thể spaCy NER

Trích xuất phòng ban, mã dự án, thời gian, nhãn bảo mật để làm giàu siêu dữ liệu lọc.

BƯỚC 4: Tạo Embedding Đa Tầng

Mô hình all-mpnet-base-v2 sinh vector 768 chiều cho từng hàng dữ liệu và đoạn văn.

➔ Nạp đồng bộ vào Kho Chỉ Mục Kép
🗄️

Trụ Cột Lưu Trữ Kép

Dual Index Storage Core

Cốt Lõi
1. FAISS Vector DB Dense

Cấu trúc đồ thị HNSW Graph ($M=32, ef=200$). Tìm kiếm ngữ nghĩa sâu, phát hiện tài liệu đồng nghĩa và liên quan gián tiếp.

2. BM25 Inverted Index Sparse

Bảng chỉ mục ngược khớp từ khóa chính xác: mã định danh nhân sự (ID), số hiệu quy chế, mã hợp đồng và tên món ăn.

⚡ Ưu thế vượt trội: Bù trừ hoàn hảo giữa năng lực hiểu ngữ nghĩa của Dense và khả năng khớp chính xác mã từ khóa của Sparse.
🠔 Khớp Song Song Cho Online Query ➔
⚡

2. Suy Luận & Tác Tử

Online Inference & Agentic Loop

Thời gian thực
BƯỚC 1: Câu Hỏi & Ngữ Cảnh Hội Thoại

Tiếp nhận truy vấn người dùng kết hợp bộ nhớ đệm 10 lượt hội thoại gần nhất.

BƯỚC 2: Truy Xuất Lai Dung Hợp Trọng Số

Truy vấn đồng thời FAISS + BM25: Score = 0.6·Dense + 0.4·Sparse.

BƯỚC 3: Tái Xếp Hạng Chéo (Cross-Encoder)

Dùng ms-marco-MiniLM-L-12-v2 chấm điểm chéo theo cặp, nâng MRR lên 0.85.

BƯỚC 4: Tạo Sinh Neo Dữ Liệu (Strict Grounding)

LLM (Mistral/LLaMA) chỉ trả lời dựa trên tài liệu truy xuất, đạt độ trung thực 4.6/5.0.

BƯỚC 5: Vòng Lặp Phản Hồi Tự Thích Ứng

Nếu nhận phản hồi chưa hài lòng, hệ thống tự động viết lại & mở rộng câu hỏi để truy xuất lại.

🎯 Độ chuẩn xác Precision@5 đạt 90% (+15%)
03

6 Trọng Tâm Đổi Mới Kỹ Thuật (Key Innovations)

Các cải tiến cụ thể tạo nên bước nhảy vọt hiệu năng

Trụ Cột 1 Data Engineering

Lập Chỉ Mục Cấp Độ Hàng (Row-Level Indexing)

Không gộp cả bảng vào 1 chunk. Khung sườn dùng Camelot trích xuất sang JSON, sau đó tách từng hàng thành một bản ghi riêng biệt có gắn kèm tên tệp, tên cột và tiêu đề. Nhờ đó, các truy vấn tra cứu từng nhân viên hay từng dòng ngân sách đạt độ chuẩn xác tuyệt đối.

Công cụ: Camelot + pdfplumber Độ mịn cao
Trụ Cột 2 NLP & Semantics

Phân Đoạn Ngữ Nghĩa & spaCy NER

Văn bản được phân đoạn đệ quy theo ngữ nghĩa với độ dài tối ưu 2.000 ký tự (overlap 500 ký tự). Mỗi đoạn được quét qua spaCy NER để làm giàu siêu dữ liệu: nhận diện thực thể (địa điểm, ngày tháng, tổ chức), phòng ban và cấp độ bảo mật.

Mô hình NER: spaCy Bảo toàn ngữ cảnh
Trụ Cột 3 Search Strategy

Truy Xuất Lai Dung Hợp Trọng Số

Khắc phục nhược điểm của việc chỉ dùng 1 phương pháp. Điểm tổng hợp được tối ưu hóa qua thực nghiệm:
Score = 0.6 × Dense + 0.4 × BM25 Tận dụng sức mạnh hiểu ngữ nghĩa của all-mpnet-base-v2 và khả năng bắt đúng từ khóa của BM25.

FAISS HNSW: M=32, ef=200 Chuẩn xác 90%
Trụ Cột 4 Contextual Scoring

Tái Xếp Hạng Bằng Cross-Encoder

Bi-encoder (Dense embedding) tính điểm cosine độc lập nên có thể lọt tài liệu nhiễu. Hệ thống đưa Top-K ứng viên qua bộ Cross-Encoder (ms-marco-MiniLM-L-12-v2) để phân tích độ tương tác sâu chéo giữa câu hỏi và đoạn trích, đẩy tài liệu liên quan nhất lên đầu.

Model: MiniLM-L-12-v2 MRR đạt 0.85
Trụ Cột 5 Agentic Refinement

Tinh Chỉnh Truy Vấn & Vòng Lặp Phản Hồi

Tích hợp cơ chế viết lại (Query Rewriting) và mở rộng truy vấn (Query Expansion) bằng LLM. Khi người dùng đánh giá tiêu cực (👎), hệ thống không giữ nguyên kết quả cũ mà tự động kích hoạt LLM phân tích lại ý định, sinh truy vấn bổ trợ và thực hiện truy xuất lại.

Bộ nhớ: 10 tương tác gần nhất Tự thích ứng
Trụ Cột 6 Architecture Scalability

Chỉ Mục Kép (Dual Index) & Prompt Tiếp Đất

Thiết kế hai chỉ mục song song: Chỉ mục chính xác cao (all-mpnet-base-v2) cho server mạnh và Chỉ mục siêu nhẹ (paraphrase-MiniLM-L3-v2) cho thiết bị hạn chế tài nguyên. Kèm theo mẫu câu nhắc bắt buộc trích dẫn nguồn và tóm tắt nếu câu dài hơn 3 dòng.

LLMs: Mistral-7B / LLaMA Chống ảo giác
04

Kết Quả Đánh Giá Thực Nghiệm Đối Đầu

So sánh Direct LLM Prompting, Naive RAG và Advanced RAG trên tập dữ liệu doanh nghiệp

Thước Đo Đánh Giá (Evaluation Metric) Direct LLM (Chỉ Prompting) Naive RAG (Baseline) Advanced RAG (Đề Xuất) Mức Độ Cải Thiện
Precision@5
Tỷ lệ tài liệu hữu ích trong top 5 kết quả
62% 75% 90% +15% (vs Naive)
Recall@5
Độ bao phủ toàn bộ tài liệu liên quan
58% 74% 87% +13% (vs Naive)
Mean Reciprocal Rank (MRR)
Vị trí thứ hạng của kết quả đúng đầu tiên
0.60 0.69 0.85 +16% (vs Naive)
Tính Trung Thực (Faithfulness)
Mức độ bám sát tài liệu nguồn, không bịa đặt (thang 5)
2.8 / 5.0 3.0 / 5.0 4.6 / 5.0 +53.3% chất lượng
Độ Hoàn Thiện (Completeness)
Mức độ trả lời đầy đủ các vế câu hỏi (thang 5)
2.3 / 5.0 2.5 / 5.0 4.2 / 5.0 +68.0% độ sâu
Độ Liên Quan (Relevance)
Tính trúng đích và hữu ích trực tiếp của câu trả lời (thang 5)
2.9 / 5.0 3.2 / 5.0 4.5 / 5.0 +40.6% chuẩn xác

So Sánh Thước Đo Định Lượng (%)

Precision@5 90% (Đề xuất) vs 75% (Naive) vs 62% (LLM)
Recall@5 87% (Đề xuất) vs 74% (Naive) vs 58% (LLM)
Mean Reciprocal Rank (MRR × 100) 85% (Đề xuất) vs 69% (Naive) vs 60% (LLM)

Đánh Giá Định Tính Bởi Chuyên Viên (Thang điểm 5)

Tính Trung Thực (Faithfulness) 4.6 / 5.0 (Đề xuất) vs 3.0 (Naive)
Độ Hoàn Thiện (Completeness) 4.2 / 5.0 (Đề xuất) vs 2.5 (Naive)
Độ Liên Quan Ngữ Cảnh (Relevance) 4.5 / 5.0 (Đề xuất) vs 3.2 (Naive)
05

Hạn Chế Hiện Tại & Hướng Mở Rộng Tương Lai

Những thách thức cần tháo gỡ để thương mại hóa toàn diện

Hạn Chế (Limitations)
  • • Lập chỉ mục tĩnh (Static Indexing): Mỗi khi kho tài liệu cập nhật chính sách mới cần tái lập chỉ mục toàn bộ (full reindexing), chưa hỗ trợ cơ chế nạp gia tăng thời gian thực.
  • • Bảng lồng nhau phức tạp (Nested / Merged Cells): Vẫn gặp hạn chế khi phân tích bảng có nhiều cấp tiêu đề lồng nhau hoặc các ô bị gộp (merged cells).
  • • Phụ thuộc phản hồi tường minh: Chỉ tối ưu truy vấn khi người dùng bấm thích/không thích. Cần khai thác thêm tín hiệu tương tác ngầm (thời gian đọc, click).
  • • Độ trễ dung hợp khi dữ liệu khổng lồ: Quá trình dung hợp Dense + Sparse và Reranking với hàng triệu bản ghi sẽ gây áp lực lớn về độ trễ tính toán.
Định Hướng Tương Lai (Future Work)
  • • Hệ thống RAG Mang Tính Tác Tử (Agentic RAG): Tích hợp các Agent tự chủ (ReAct / Reflexion) có khả năng tự suy luận, chủ động chọn chiến lược truy xuất động theo từng tình huống.
  • • Mở rộng Đa Phương Thức (Multimodal Data): Tiếp nhận tài liệu quét (scanned PDFs), sơ đồ kiến trúc doanh nghiệp, đồ thị báo cáo tài chính và biểu đồ kỹ thuật.
  • • Mô hình Hiểu Bảng Chuyên Sâu: Tích hợp mô hình tiền huấn luyện sâu dạng bảng như TAPAS hoặc TURL để xử lý các bảng lồng ghép phức tạp.
  • • Lập chỉ mục động gia tăng (Dynamic Indexing): Tự động bổ sung tài liệu mới vào FAISS HNSW mà không cần dừng hệ thống.

Tổng Kết & Đóng Góp Tri Thức Cho Dự Án SmartRestaurant

Bài báo cung cấp giải pháp mẫu hoàn hảo cho hệ thống SmartRestaurant: Giải quyết bài toán dữ liệu thực đơn có giá, nguyên liệu, bảng công thức món ăn (dữ liệu có cấu trúc dạng bảng) kết hợp với các bài viết giới thiệu ẩm thực và đánh giá của khách hàng (dữ liệu phi cấu trúc) bằng cơ chế Truy xuất Lai (Hybrid Retrieval) và Lập chỉ mục cấp độ hàng (Row-level Indexing).

Tác giả: Chandana Cheerla (IIT Roorkee)
Mô hình: all-mpnet-base-v2 + BM25
Bộ rerank: ms-marco-MiniLM-L-12-v2