# AI-Driven Multi-Document Correlation for Enterprise Financial Compliance and Fraud Detection

Varsha Shah · Tata Consultancy Services · AI Engineer World's Fair 2026: Online Track

> Gian lận nằm giữa các tài liệu: nối payroll, thuế, mua hàng bằng graph, chấm risk score theo xác suất, chuẩn hoá giữa các jurisdiction.

Topics: Finance, Evals

Canonical: https://homus.dev/talks/ai-driven-multi-document-correlation-for-enterprise-financial-compliance-and-fraud-detection

## 1. Varsha là ai và talk này nói về điều gì

Varsha Shah mở đầu bằng lời cảm ơn đội ngũ AI Engineer World's Fair đã cho cô cơ hội chia sẻ nghiên cứu của mình, và nói rằng được nói chuyện cùng rất nhiều researcher và practitioner tài năng là một vinh dự thật sự. Cô giới thiệu mình là enterprise technical architect làm việc tại Tata Consultancy Services, làm cho Microsoft. Mảng cô tập trung là artificial intelligence, compliance trong doanh nghiệp, finance governance (quản trị tài chính) và intelligent automation.

Chủ đề hôm nay là nghiên cứu của cô về AI-driven multi-document correlation, tức là dùng AI để nối và đối chiếu nhiều tài liệu với nhau, áp dụng cho compliance tài chính trong doanh nghiệp và fraud detection (phát hiện gian lận).

Bối cảnh cô đặt ra như sau. Khi các tổ chức tiếp tục số hoá hoạt động, họ tạo ra một lượng dữ liệu khổng lồ cho hệ thống tài chính, trải khắp payroll (bảng lương), tax (thuế), procurement (mua hàng) và các hệ thống giao dịch. Điều trớ trêu là: dù có nhiều dữ liệu hơn bao giờ hết, các đội compliance vẫn vật lộn với những mẫu gian lận ẩn và rủi ro về quy định. Lý do, theo Varsha, là phần lớn các giải pháp hiện có phân tích từng tài liệu một cách độc lập, trong khi nhiều rủi ro nghiêm trọng nhất chỉ lộ ra khi thông tin được nối lại xuyên qua nhiều hệ thống.

Trong bài này cô giới thiệu một framework kết hợp ba thứ: graph-based entity correlation (nối các thực thể bằng đồ thị), probabilistic risk modeling (mô hình rủi ro theo xác suất) và cross-jurisdictional normalization (chuẩn hoá dữ liệu giữa các vùng pháp lý khác nhau). Mục tiêu là làm lộ ra những quan hệ ẩn này, và biến compliance trong doanh nghiệp từ một quy trình phản ứng sau sự việc (reactive) thành một năng lực tình báo chủ động (proactive intelligence). Framework đã được đánh giá trên khoảng ba triệu record tài chính thuộc bốn jurisdiction, cho thấy cả hiệu năng phát hiện mạnh lẫn cải thiện đáng kể về vận hành. Với bối cảnh đó, cô bắt đầu bằng việc nhìn vào khoảng trống compliance mà các tổ chức vẫn đang gặp.

![Slide tiêu đề talk của Varsha Shah](https://homus.dev/photos/Iwe_RY-fYgI-0000.jpg)

Slide mở đầu: tên đầy đủ của talk, kèm một dòng mô tả framework phát hiện gian lận xuyên tài liệu bằng relational intelligence, được đánh giá trên 3 triệu record đã ẩn danh và bốn jurisdiction. Slide ký tên Varsha Shah, Enterprise Technical Architect, USA.

## 2. The compliance gap: khoảng trống chưa ai lấp

Varsha nhắc lại: hãy bắt đầu bằng việc hiểu cái compliance gap mà rất nhiều tổ chức vẫn đang đối mặt. Compliance trong doanh nghiệp đã phức tạp hơn hẳn trong mười năm qua, và cô chỉ ra ba lực đẩy.

**Thứ nhất, nhiều jurisdiction cùng lúc.** Các tổ chức giờ hoạt động xuyên nhiều quốc gia, nhiều khung quy định và nhiều hệ thống tài chính, mỗi nơi có chuẩn báo cáo và yêu cầu compliance riêng. Trên slide, ý này được viết thành: các quy định chồng lấn và khác nhau giữa các hệ thống toàn cầu tạo ra những điểm mù mà công cụ thủ công và công cụ rule-based không đối chiếu nổi.

**Thứ hai, khối lượng dữ liệu tăng theo cấp số nhân.** Bảng lương, hồ sơ khai thuế, giao dịch mua hàng và các tài liệu tài chính sinh ra mỗi ngày, khiến việc review thủ công vừa tốn thời gian vừa ngày càng không khả thi.

**Thứ ba, gian lận đã tiến hoá.** Gian lận hiện đại hiếm khi xuất hiện như một lỗi hiển nhiên nằm gọn trong một tài liệu. Thay vào đó, nó khai thác những điểm không nhất quán rất nhỏ giữa nhiều hệ thống, những pattern thường vô hình khi từng record được xem xét riêng lẻ.

Điều này tạo ra một giới hạn mang tính nền tảng. Các hệ thống truyền thống, dạng rule-based và NLP ở mức tài liệu, được thiết kế để kiểm tra từng record riêng, nhưng chúng không được xây để hiểu quan hệ giữa các tài liệu. Đó chính là khoảng trống mà nghiên cứu này muốn giải quyết: vượt qua kiểu phân tích tài liệu cô lập để làm lộ rủi ro ẩn bằng cross-document correlation, tức là đối chiếu xuyên tài liệu.

![Slide The Compliance Gap No One Is Closing với ba ô](https://homus.dev/photos/Iwe_RY-fYgI-0200.jpg)

Slide "The Compliance Gap No One Is Closing" gom ba lực đẩy thành ba ô: Multi-Jurisdictional Complexity, Growing Data Volumes và Sophisticated Fraud Patterns. Dòng dưới cùng kết luận rằng hệ thống rule-based và hệ thống có thêm NLP, khi chỉ làm ở mức từng tài liệu, về cấu trúc không thể phát hiện các bất thường xuyên tài liệu.

## 3. Vì sao phân tích ở mức từng tài liệu không đủ

Để hiểu rõ giới hạn này, Varsha mô tả cách phần lớn hệ thống compliance đang vận hành hiện nay: chúng đánh giá từng tài liệu độc lập. Một payroll register (sổ lương) được kiểm tra theo quy tắc payroll. Hoá đơn của vendor được kiểm tra theo chính sách procurement. Một hồ sơ khai thuế được review theo quy định thuế. Nếu mỗi tài liệu qua được bước kiểm tra riêng của nó, giao dịch thường được coi là compliant.

Vấn đề là nhiều mẫu gian lận tinh vi thật ra không hiện ra trong một tài liệu đơn lẻ. Chúng chỉ nổi lên khi nhiều tài liệu được phân tích cùng nhau. Ví dụ cô đưa ra: một record payroll có thể trông chính xác với chúng ta, một hoá đơn vendor có vẻ hợp lệ, một hồ sơ thuế có thể được nộp đúng cách. Nhưng khi nối các record này lại, chúng làm lộ ra những điểm không nhất quán, và chính những điểm đó báo hiệu gian lận và rủi ro compliance.

Thông tin thì đã có sẵn. Cái còn thiếu, theo Varsha, là khả năng hiểu quan hệ giữa các tài liệu này. Vì vậy nghiên cứu chuyển trọng tâm từ document-level validation (kiểm tra từng tài liệu) sang cross-document intelligence (trí tuệ xuyên tài liệu), để các tổ chức phát hiện được những rủi ro mà nếu không thì sẽ mãi nằm ẩn.

![Slide Why Document-Level Analysis Falls Short với hình kính lúp trên chồng tài liệu](https://homus.dev/photos/Iwe_RY-fYgI-0336.jpg)

Slide "Why Document-Level Analysis Falls Short": công cụ compliance truyền thống đánh giá record một cách cô lập, nên gian lận phát sinh từ chênh lệch giữa payroll register, hoá đơn vendor và hồ sơ thuế vẫn vô hình khi mỗi tài liệu tự qua được bước kiểm tra nội bộ của nó. Ô cảnh báo màu vàng: các mẫu gian lận tốn kém nhất không nằm trong một tài liệu, chúng nổi lên ở khoảng giữa các tài liệu.

Ý chính của phần này: từng tài liệu đều qua được kiểm tra riêng của nó, rủi ro chỉ hiện ra khi các tài liệu được nối với nhau.

## 4. Tổng quan kiến trúc: ba thành phần bổ trợ nhau

Varsha đặt câu hỏi chuyển tiếp: nếu vấn đề nằm ở việc hiểu quan hệ chứ không ở từng tài liệu, vậy kiến trúc nào giải được bài toán này? Cô giới thiệu framework.

Thay vì dựa vào một model hay một thuật toán duy nhất, giải pháp được xây trên ba thành phần bổ trợ nhau, cùng làm việc để biến dữ liệu thô của doanh nghiệp thành compliance intelligence có thể hành động được.

- **Entity correlation engine.** Mục đích là nối các thông tin liên quan xuyên payroll, tax, procurement và hệ thống tài chính, tạo ra một góc nhìn thống nhất về hoạt động của doanh nghiệp thay vì những record rời rạc.

- **Adaptive probabilistic risk model.** Khi các quan hệ đã được thiết lập, thành phần thứ hai đánh giá dữ liệu đã nối để xác định pattern nào là rủi ro compliance có ý nghĩa. Thay vì sinh alert dựa trên một rule đơn lẻ, nó ưu tiên các ca bằng nhiều risk signal cùng lúc.

- **Cross-jurisdictional normalization layer.** Lớp này cung cấp bối cảnh pháp lý bằng cách chuẩn hoá tiền tệ, cấu trúc thuế, chuẩn báo cáo và quy tắc compliance giữa các jurisdiction khác nhau. Nhờ vậy rủi ro được đánh giá nhất quán, bất kể giao dịch phát sinh ở đâu.

Mỗi thành phần riêng lẻ đều có giá trị. Nhưng khi đi cùng nhau, chúng tạo nên một framework vượt khỏi việc kiểm tra từng tài liệu để tiến tới compliance intelligence ở quy mô toàn doanh nghiệp. Trong vài slide tiếp theo, cô giải thích ngắn gọn từng thành phần đóng góp vào quy trình ra sao.

![Slide Framework Architecture Overview với hình ba cột](https://homus.dev/photos/Iwe_RY-fYgI-0504.jpg)

Slide "Framework Architecture Overview" vẽ framework như một toà nhà ba cột: Entity Correlation (graph engine nối các record tài chính), Risk Modeling (tổng hợp các anomaly theo xác suất, có tính thích nghi) và Normalization Layer (hài hoà tiền tệ và chuẩn báo cáo). Dòng dưới cùng trên slide mô tả thứ tự: thực thể được nối theo quan hệ, risk signal được tổng hợp và hiệu chỉnh, còn khác biệt giữa các jurisdiction được chuẩn hoá trước khi chấm điểm.

## 5. Component 1: Graph-Based Entity Correlation Engine

Varsha bắt đầu với nền móng của framework, thứ làm cho cross-document intelligence trở thành khả thi: graph-based entity correlation engine. Vai trò của nó là nối các thực thể (entity) xuyên payroll, tax, procurement và hệ thống tài chính vào một mạng lưới thống nhất.

Thay vì phân tích từng tài liệu độc lập, engine này xác định quan hệ giữa nhân viên, vendor, tài khoản, giao dịch và các hồ sơ nộp cho cơ quan quản lý. Chính các kết nối này làm lộ ra những pattern ẩn và những bất thường về cấu trúc (structural anomaly), thứ thường vô hình với kiểu phân tích ở mức tài liệu mà chúng ta vẫn làm.

Nói đơn giản, thành phần này trả lời một câu hỏi nền tảng: **cái gì đang nối với cái gì?** Nó cung cấp nền móng quan hệ cho phần còn lại của framework. Khi quan hệ đã được thiết lập, bước tiếp theo là xác định quan hệ nào thật sự là rủi ro có ý nghĩa.

![Slide Component 1 Graph-Based Entity Correlation Engine với hình mạng lưới node](https://homus.dev/photos/Iwe_RY-fYgI-0648.jpg)

Slide Component 1 mô tả nền móng là một [knowledge graph](https://en.wikipedia.org/wiki/Knowledge_graph) thiết lập liên kết quan hệ giữa các record payroll, tax, procurement và giao dịch. Ba gạch đầu dòng: entity được chuẩn hoá và resolve (xác định là cùng một thực thể) xuyên các nguồn dữ liệu khác nhau; quan hệ giữa vendor, nhân viên, tài khoản và hồ sơ được làm nổi lên; structural anomaly được phát hiện qua phân tích topology của đồ thị.

## 6. Component 2: Adaptive Probabilistic Risk Model

Khi các quan hệ đã có, bước tiếp theo là quyết định quan hệ nào thật sự đại diện cho rủi ro có ý nghĩa. Đó là vai trò của adaptive probabilistic risk model.

Thay vì dựa vào rule tĩnh, model này kết hợp nhiều risk indicator, chẳng hạn độ mạnh của anomaly, độ tin cậy của nguồn dữ liệu, và các pattern đã từng xảy ra trong quá khứ, để tính ra một risk score dựa trên độ tin cậy (confidence-based). Điểm này giúp ưu tiên các ca cần chú ý ngay, đồng thời giảm những cuộc điều tra không cần thiết.

Ưu điểm quan trọng mà Varsha nhấn mạnh là khả năng học từ kết quả audit: model liên tục cải thiện độ chính xác theo thời gian. Nói gọn, thành phần này trả lời câu hỏi: **cái gì nhiều khả năng là rủi ro compliance thật nhất?**

![Slide Component 2 Adaptive Probabilistic Risk Model với biểu đồ các đường phân phối xác suất](https://homus.dev/photos/Iwe_RY-fYgI-0744.jpg)

Slide Component 2: các anomaly signal từ những tài liệu đã được nối được gộp lại thành risk score đã hiệu chỉnh (calibrated), dùng để ưu tiên các ca cần người review. Ba gạch đầu dòng: chấm điểm theo xác suất có tính đến độ mạnh của signal và độ tin cậy của nguồn; model thích nghi liên tục từ vòng feedback của audit; ngưỡng rủi ro cấu hình được theo từng jurisdiction và từng đơn vị kinh doanh. Hình bên phải là minh hoạ các đường phân phối chồng lên nhau của một risk scoring model.

## 7. Component 3: Cross-Jurisdictional Normalization Layer

Khi đã xác định được các ca rủi ro cao, bước cuối cùng là đảm bảo những rủi ro đó được diễn giải nhất quán giữa các môi trường pháp lý khác nhau. Thành phần cuối là cross-jurisdictional normalization layer.

Các tổ chức toàn cầu hoạt động qua nhiều quốc gia, nhiều loại tiền, nhiều cấu trúc thuế và chuẩn báo cáo. Không có chuẩn hoá, cùng một giao dịch có thể bị diễn giải khác nhau tuỳ jurisdiction. Lớp này hài hoà dữ liệu tài chính bằng cách chuẩn hoá tiền tệ, quy tắc thuế, kỳ báo cáo và cả các classification scheme (sơ đồ phân loại). Kết quả là rủi ro được đánh giá nhất quán bất kể nó phát sinh ở đâu.

Tóm lại, thành phần này trả lời câu hỏi: **rủi ro nên được diễn giải thế nào trong đúng bối cảnh pháp lý của nó?**

Trong lời nói, Varsha trình bày lớp này như bước cuối cùng, sau khi đã tìm ra các ca rủi ro cao. Còn trên slide, lớp này được mô tả là thứ phải chạy trước khi correlation có thể diễn ra, và slide tổng quan ở phần 4 cũng ghi rằng khác biệt giữa các jurisdiction được chuẩn hoá trước khi chấm điểm.

![Slide Component 3 Cross-Jurisdictional Normalization Layer với bản đồ thế giới và ký hiệu tiền tệ](https://homus.dev/photos/Iwe_RY-fYgI-0848.jpg)

Slide Component 3 ghi rằng trước khi correlation có thể diễn ra, các chuẩn báo cáo tài chính khác nhau phải được đối chiếu cho khớp. Lớp này hài hoà: quy đổi tiền tệ và điều chỉnh tỷ giá; khác biệt cấu trúc thuế giữa các jurisdiction; căn chỉnh kỳ báo cáo và schema phân loại. Nhờ đó risk model chấm điểm các entity nhất quán bất kể xuất xứ địa lý.

## 8. Điều kiện đánh giá: ba triệu record, bốn jurisdiction, năm năm

Với cả ba thành phần cùng chạy, bước tiếp theo là đánh giá framework hoạt động thế nào trong điều kiện doanh nghiệp thật. Trước khi nói về kết quả, Varsha cho rằng rất quan trọng là hiểu ngắn gọn môi trường đánh giá.

Framework được đánh giá trên khoảng ba triệu record tài chính, thu thập trong khoảng thời gian năm năm, thuộc bốn jurisdiction pháp lý khác nhau. Mục tiêu là xem framework hoạt động ra sao trong điều kiện doanh nghiệp thực tế, nơi một khối lượng lớn dữ liệu tài chính liên kết chằng chịt với nhau và các yêu cầu pháp lý khác nhau tạo ra độ phức tạp đáng kể.

Đặt xong nền móng đó, cô chuyển sang câu hỏi chính: framework hiệu quả đến đâu trong việc phát hiện rủi ro compliance ẩn?

![Slide Evaluation Conditions với ba ô và ảnh phòng máy chủ](https://homus.dev/photos/Iwe_RY-fYgI-0944.jpg)

Slide "Evaluation Conditions": Dataset Scale khoảng 3 triệu record tài chính đã ẩn danh; Jurisdictions là bốn môi trường pháp lý riêng biệt được đánh giá song song; Time Horizon là năm năm dữ liệu lịch sử phản ánh điều kiện doanh nghiệp thật.

## 9. Kết quả detection: precision, recall, F1

Varsha đi vào hiệu năng phát hiện. Framework đạt precision khoảng 91%, nghĩa là phần lớn các ca bị gắn cờ đã được xác nhận là anomaly thật. Nó cũng đạt recall 87%, cho thấy khả năng tìm ra hầu hết các ca gian lận thật trong khi giảm thiểu số ca bị bỏ sót.

Gộp lại, hai con số này cho F1 score là 0.89, thể hiện sự cân bằng tốt giữa precision và recall. Quan trọng hơn, theo cô, các kết quả này đạt được trên cả bốn jurisdiction và trên dữ liệu ở quy mô doanh nghiệp lớn, chứng tỏ framework hoạt động ổn định trong môi trường thực tế phức tạp.

Để đọc ba con số này cho đúng: [precision](https://en.wikipedia.org/wiki/Precision_and_recall) là tỷ lệ ca bị gắn cờ mà đúng là có vấn đề, recall là tỷ lệ ca có vấn đề thật mà hệ thống bắt được, còn [F1 score](https://en.wikipedia.org/wiki/F-score) là trung bình điều hoà (harmonic mean) của hai con số kia.

Câu hỏi tiếp theo, theo Varsha, cũng quan trọng không kém: những cải thiện này chuyển thành giá trị vận hành gì cho các đội compliance?

![Slide Detection Performance Results với ba con số 91%, 87% và 0.89](https://homus.dev/photos/Iwe_RY-fYgI-1040.jpg)

Slide "Detection Performance Results": Precision khoảng 91% (ca bị gắn cờ được xác nhận là anomaly thật), Recall khoảng 87% (ca gian lận thật được hệ thống làm nổi lên), F1 Score khoảng 0.89 (trung bình điều hoà cân bằng precision và recall). Ghi chú cuối slide: hiệu năng được đo so với ground truth có gán nhãn, lấy từ các kết luận audit đã được xác nhận, trên cả bốn jurisdiction và trọn khung đánh giá năm năm.

## 10. Hiệu quả vận hành: ít false positive, ít audit thủ công

Độ chính xác phát hiện chỉ là một phần câu chuyện. Giá trị thật, theo Varsha, đến từ việc làm cho hoạt động compliance hiệu quả hơn. Ngoài độ chính xác, framework mang lại những lợi ích vận hành đo được.

Một trong những kết quả đáng kể nhất là false positive giảm 76%, nghĩa là các điều tra viên tốn ít thời gian hơn hẳn để review những ca mà rốt cuộc là hợp lệ. Ngoài ra, framework giảm khoảng 40% công sức audit thủ công, cho phép đội compliance chỉ tập trung vào các ca rủi ro cao thay vì review tài liệu thường lệ.

Cuối cùng, điều này chuyển thành điều tra nhanh hơn, dùng nguồn lực tốt hơn, và tự tin hơn vào các quyết định compliance. Nói cách khác, framework không chỉ phát hiện gian lận hiệu quả hơn, nó giúp đội compliance làm việc hiệu quả hơn.

![Slide Operational Efficiency Gains với hai vòng tròn 9% và 40%](https://homus.dev/photos/Iwe_RY-fYgI-1152.jpg)

Slide "Operational Efficiency Gains" trình bày theo tỷ lệ: False Positive Rate khoảng 9%, giảm từ khoảng 38% ở các hệ thống baseline dạng rule-based; Audit Workload Reduction khoảng 40%, tức cần ít lượt review thủ công hơn trong mỗi chu kỳ compliance. Phần "What This Means in Practice" ghi: giảm 76% false positive nghĩa là bớt hẳn số giờ điều tra viên dành cho những ca không có gì, còn giảm 40% khối lượng audit thủ công giải phóng đội compliance để dồn năng lực phân tích vào các ca rủi ro có độ tin cậy cao thay vì triage thường lệ. Từ 38% xuống 9% chính là mức giảm khoảng 76% mà Varsha nói.

## 11. So với các hệ thống baseline

Những cải thiện vận hành này càng có ý nghĩa khi đặt framework cạnh các cách tiếp cận rule-based truyền thống. Phần so sánh này làm rõ lợi thế của việc vượt khỏi hệ thống rule-based.

Các cách tiếp cận thông thường làm tốt việc kiểm tra từng record riêng, nhưng thường chật vật khi phải phát hiện những mẫu gian lận phức tạp trải qua nhiều tài liệu và nhiều hệ thống. Bằng cách đưa vào entity correlation, probabilistic risk modeling và regulatory normalization, framework được đề xuất liên tục vượt baseline trên các metric hiệu năng chính.

Varsha nói key takeaway rất đơn giản: nối dữ liệu xuyên tài liệu cho ra detection tốt hơn, ít false positive hơn, và compliance intelligence dễ hành động hơn so với phân tích từng tài liệu một cách cô lập.

![Slide Comparison Against Baseline Systems với ba khung so sánh](https://homus.dev/photos/Iwe_RY-fYgI-1256.jpg)

Slide "Comparison Against Baseline Systems" xếp ba thế hệ cạnh nhau. Rule-Based Systems: false positive cao khoảng 38%, chỉ ở mức tài liệu, không có adaptive learning. NLP-Augmented Systems: false positive trung bình, cross-document một phần, khả năng thích nghi hạn chế. AI Multi-Document Correlation Framework: false positive thấp khoảng 9%, cross-document correlation đầy đủ, adaptive learning liên tục từ feedback của audit.

## 12. Continuous adaptive learning: mỗi cuộc audit làm cuộc sau tốt hơn

Một trong những lý do framework tiếp tục tốt lên theo thời gian là nó không còn dựa vào rule tĩnh. Thay vào đó, nó liên tục học từ các cuộc audit đã hoàn tất và từ feedback của điều tra viên.

Framework được thiết kế để cải thiện liên tục qua feedback. Mỗi cuộc audit hoàn tất cung cấp thông tin giá trị. Ca gian lận được xác nhận giúp củng cố các pattern phát hiện trong tương lai. Còn false positive giúp tinh chỉnh risk scoring và giảm những alert không cần thiết. Điều này tạo ra một vòng học liên tục, nơi hệ thống chính xác hơn sau mỗi cuộc audit và điều tra.

Khi các mẫu gian lận tiến hoá và môi trường kinh doanh thay đổi, framework thích nghi theo thay vì phải chờ người cập nhật rule bằng tay. Nói đơn giản, mỗi cuộc audit hoàn tất giúp cuộc audit tiếp theo hiệu quả hơn.

Năng lực học liên tục này mở đường cho một sự chuyển dịch rộng hơn: từ phản ứng với vấn đề compliance sau khi chúng xảy ra, sang nhận diện rủi ro trước khi chúng trở thành kết luận audit. Varsha gọi đó là cách làm chủ động hơn.

![Slide Continuous Adaptive Learning với vòng feedback Plan, Measure, Improve, Act](https://homus.dev/photos/Iwe_RY-fYgI-1400.jpg)

Slide "Continuous Adaptive Learning": khác với bộ rule tĩnh cần cập nhật thủ công, framework có một vòng feedback có cấu trúc từ các cuộc audit đã xong; pattern gian lận đã xác nhận và các lần sửa false positive được dùng để hiệu chỉnh lại probabilistic risk model theo thời gian. Ô thông tin: mỗi chu kỳ audit hoàn tất cải thiện độ chính xác cho chu kỳ sau, hệ thống học từ cả ca gian lận đã xác nhận lẫn ca đã được gỡ nghi, giảm drift trong môi trường gian lận thay đổi nhanh. Hình bên trái là vòng Plan, Measure, Improve, Act.

## 13. Từ reactive validation sang predictive governance

Ngoài việc tăng độ chính xác phát hiện, framework thay đổi cách tổ chức tiếp cận compliance. Theo truyền thống, compliance mang tính phản ứng: vấn đề chỉ được phát hiện sau khi audit, điều tra hay review của cơ quan quản lý đã diễn ra.

Framework này cho phép một cách tiếp cận chủ động hơn thông qua continuous monitoring (giám sát liên tục), cross-document correlation và adaptive learning. Thay vì hỏi "chuyện gì đã sai", tổ chức có thể bắt đầu hỏi "chuyện gì nhiều khả năng sẽ sai tiếp theo".

Đó là bước chuyển từ reactive validation sang predictive governance (quản trị dự báo), cho phép đội compliance nhận diện rủi ro sớm hơn, ưu tiên điều tra hiệu quả hơn, và ra quyết định dựa trên nhiều thông tin hơn. Rốt cuộc, compliance trở thành một chức năng tình báo liên tục chứ không còn là một quy trình review định kỳ.

![Slide From Reactive to Predictive Governance với con đường ba mốc](https://homus.dev/photos/Iwe_RY-fYgI-1504.jpg)

Slide "From Reactive to Predictive Governance" vẽ một con đường qua ba mốc: Reactive Validation (kiểm tra rule sau sự việc), Continuous Monitoring (cross-document correlation theo thời gian thực) và Predictive Governance (risk intelligence thích nghi với feedback từ audit). Dòng cuối: framework định nghĩa lại compliance thành một chức năng tình báo liên tục thay vì một bài kiểm tra định kỳ, giúp làm nổi rủi ro trước khi nó thành kết luận audit.

## 14. Những điều cần tính khi deploy thật

Dù framework xuất phát từ nghiên cứu, Varsha nói nó được thiết kế với việc deploy trong doanh nghiệp ngay từ đầu. Triển khai thành công phụ thuộc vào bốn điều cần cân nhắc:

- **Tích hợp liền mạch với các hệ thống sẵn có của doanh nghiệp**, như ERP, payroll, procurement và các nền tảng thuế.

- **Cấu hình riêng cho từng jurisdiction**, để đảm bảo tuân thủ quy định và chuẩn báo cáo địa phương.

- **Khớp với audit framework**, để điều tra viên tập trung vào các ca đã được chấm điểm rủi ro và xếp ưu tiên, thay vì review tài liệu thủ công.

- **Khả năng mở rộng (scalability).** Kết quả đánh giá cho thấy framework xử lý hiệu quả hàng triệu record tài chính, phù hợp cho môi trường doanh nghiệp lớn.

Gộp lại, theo cô, bốn điều này giúp lấp khoảng cách giữa nghiên cứu và việc doanh nghiệp áp dụng trong thực tế.

![Slide Practical Deployment Considerations với bốn ô](https://homus.dev/photos/Iwe_RY-fYgI-1552.jpg)

Slide "Practical Deployment Considerations" chi tiết hơn lời nói. Data Integration: framework cần connector có cấu trúc tới payroll, ERP, procurement và hệ thống thuế, tận dụng data pipeline sẵn có khi chuẩn hoá schema được. Jurisdictional Configuration: normalization layer phải được tham số hoá cho từng jurisdiction đang hoạt động, bộ rule pháp lý và tham chiếu tiền tệ cần bảo trì định kỳ. Audit Team Alignment: workflow của điều tra viên nên được thiết kế lại để dùng output đã chấm điểm rủi ro thay vì hàng đợi tài liệu thô, và việc đào tạo rút ngắn đáng kể thời gian tới khi có giá trị. Scalability: phần tính toán trên đồ thị và chấm điểm xác suất mở rộng theo chiều ngang, và đợt đánh giá trên 3 triệu record cho thấy phù hợp với môi trường doanh nghiệp lớn.

## 15. Bốn key takeaway và lời kết

Để kết thúc, Varsha để lại bốn key takeaway:

- Nhiều rủi ro compliance và gian lận đáng kể nhất hiện nay nằm **giữa** các tài liệu, không nằm **trong** chúng. Phát hiện được các rủi ro này đòi hỏi vượt khỏi phân tích ở mức tài liệu để tiến tới cross-document intelligence.

- Kết hợp graph-based entity correlation, probabilistic risk modeling và cross-jurisdictional normalization tạo ra một cách tiếp cận compliance doanh nghiệp toàn diện hơn và dễ mở rộng hơn.

- Kết quả cho thấy framework này không chỉ tăng độ chính xác phát hiện, mà còn giảm false positive và giảm đáng kể công sức audit thủ công, mang lại giá trị vận hành đo được.

- Bằng cách học liên tục từ kết quả audit, framework giúp các tổ chức đi từ compliance kiểu phản ứng sang quản trị rủi ro mang tính dự báo, dựa trên intelligence.

Varsha tin rằng đây là một bước quan trọng hướng tới tương lai của quản trị tài chính doanh nghiệp, nơi AI không chỉ giúp các tổ chức phát hiện rủi ro, mà còn lường trước và ngăn chặn rủi ro về sau.

Cô cảm ơn một lần nữa đội ngũ AI Engineer World's Fair vì cơ hội tuyệt vời này và cảm ơn mọi người đã dành thời gian lắng nghe. Cô mời mọi người liên hệ với câu hỏi và sự hứng thú của mình, hoặc kết nối với cô trên LinkedIn. Nếu bạn đang xây những hệ thống như vậy cho compliance bằng AI và muốn chuyển đổi chúng, cô sẵn lòng giúp. Cô cảm ơn mọi người lần nữa và hẹn gặp lại lần sau.

![Slide Key Takeaways với bốn điểm đánh số](https://homus.dev/photos/Iwe_RY-fYgI-1656.jpg)

Slide "Key Takeaways" diễn đạt bốn điểm hơi khác lời nói: cross-document correlation làm lộ gian lận mà công cụ ở mức tài liệu không phát hiện được; kiến trúc ba thành phần mang lại precision, recall và hiệu quả vận hành đo được ở quy mô doanh nghiệp; adaptive learning từ feedback của audit tạo ra một tư thế compliance cải thiện liên tục theo thời gian; framework chuyển quản trị tài chính từ reactive validation sang quản trị rủi ro dự báo, dựa trên intelligence.

## Nguồn và liên kết

- Trang talk chính thức: [ai.engineer/talks/Iwe_RY-fYgI](https://ai.engineer/talks/Iwe_RY-fYgI)

- Varsha Shah trên GitHub: [github.com/VarshaShahTech](https://github.com/VarshaShahTech) · LinkedIn: linkedin.com/in/varsha-shah-7b5111247

- Tata Consultancy Services: tcs.com

- Định nghĩa precision, recall: [Wikipedia, Precision and recall](https://en.wikipedia.org/wiki/Precision_and_recall) · F1: [Wikipedia, F-score](https://en.wikipedia.org/wiki/F-score)

- Knowledge graph: [Wikipedia, Knowledge graph](https://en.wikipedia.org/wiki/Knowledge_graph)
