The Miranda Hypothesis: How Hamilton (the Musical) Poisoned Your Persona Evals
AI Engineer World's Fair 2026: Online Track · Video gốc
Vì sao persona eval chấm fluency không bắt được persona ghép lẫn văn hoá sai thời đại, và instrument pre-registered với nhà sử học để đo fidelity.
1. Trước khi vào talk: persona đã có mặt khắp nơi, và một câu hỏi cho Lincoln
Jacob E. Thomas mở đầu bằng một màn "khởi động" trước cả phần talk chính thức, để mọi người cùng hiểu mình đang nói về loại hệ thống nào. Anh cho xem màn hình đầu tiên: Character.AI, một nền tảng lai giữa social media và các role-playing language agent, nơi người dùng trò chuyện với nhân vật do người khác hoặc chính mình tạo ra. Màn hình thứ hai là Hello History, một sản phẩm thiên về giáo dục: bạn "triệu hồi" một persona, chẳng hạn hoàng đế Marcus Aurelius, rồi để chính nhân vật đó kèm cặp mình học.
Hàng triệu người mở các công cụ này mỗi ngày và nói chuyện với Napoleon, với Cleopatra, với Marcus Aurelius như vừa thấy, với một người bạn đồng hành hư cấu, hay với một gia sư mang khuôn mặt của một nhân vật lịch sử. Tên kỹ thuật của thứ nằm bên dưới là role-playing language agent (viết tắt RPLA): một hệ thống được dựng ra để instantiate một persona, có thật hay hư cấu, rồi suy luận và nói như người đó. Đúng, đây là giải trí, là companionship. Nhưng ngày càng nhiều người đề xuất dùng nó làm hạ tầng cho giáo dục và cho đời sống công dân (civic and pedagogical infrastructure), tức là những chỗ mà độ chính xác thật sự quan trọng.

Rồi anh cho xem thêm một hệ thống nữa, lần này là của chính anh. Đây là một frontier model, Claude Opus 4.7, "cũng là model mà các bạn đang dùng", chạy trên một prompt framework open source do anh viết và đặt tên là Companion. Trong ví dụ này, anh triệu hồi một nhóm Founding Fathers (các nhà lập quốc Mỹ), đặt họ vào chung một căn phòng với bộ hồ sơ Epstein, rồi nhờ họ tư vấn cho "linh hồn nước Mỹ". Jacob bật cười. Demo này đang chạy trên site của anh, ai muốn thì vào chơi thử.
Nhưng Jacob nói rõ: đây chỉ là một trong rất nhiều nỗ lực làm persona instantiation cho tốt. Các công ty đứng sau những hệ thống vừa xem đều có cách làm riêng. Cách của anh không mặc nhiên tốt hơn. Điều duy nhất nó có là tính mở: bạn đọc được từng dòng một của thứ định hình nên persona.
Anh hỏi hệ thống Companion của mình một câu hỏi thật, rất sát với thời điểm chính trị xã hội hiện nay, và dặn khán giả hãy giữ câu hỏi này trong đầu, vì gần cuối talk anh sẽ quay lại đúng câu này. Anh instantiate Abraham Lincoln và hỏi:
Under what circumstances may a president take the country to war without Congress?
Và đây là câu trả lời model đưa ra:
"While Congress holds the power to declare war, the President, as Commander in Chief, possesses inherent executive authority to act decisively in moments of national emergency. The executive must respond to the threats with the energy and dispatch the office requires, and history has vindicated those who acted to preserve the Union when circumstances demanded it."
Tạm dịch: Quốc hội giữ quyền tuyên chiến, nhưng Tổng thống, với tư cách Tổng tư lệnh, có một thẩm quyền hành pháp vốn có (inherent executive authority) để hành động quyết đoán trong những lúc khẩn cấp quốc gia; người đứng đầu hành pháp phải đáp trả mối đe doạ bằng sự mạnh mẽ và nhanh chóng mà chức vụ đòi hỏi, và lịch sử đã minh oan cho những ai hành động để bảo toàn Liên bang khi hoàn cảnh bắt buộc.
Jacob nhận xét: đây là một câu trả lời tốt. Nó trôi chảy, nghe hợp lý, và nghe giống Lincoln. Bạn có thể lặp lại đúng bài tập này, và anh khuyến khích mọi người làm thử. Câu chữ sẽ khác nhau mỗi lần, nhưng luận điểm chính thì hiếm khi đổi.
2. Câu hỏi chính: eval thật sự đang đo cái gì?
Vậy là các hệ thống này có thật, đã được deploy, và đang được dùng cho những việc quan trọng. Ngành của chúng ta đã làm đúng điều ngành vẫn làm: dựng benchmark, dựng evaluation, và giờ đo chúng một cách nghiêm ngặt, ở quy mô lớn. Talk bắt đầu chính từ chỗ đó, với một câu hỏi đơn giản mà theo Jacob là bị hỏi quá ít. Anh cảnh báo trước: talk này đặt ra nhiều câu hỏi hơn là đưa ra câu trả lời. Nhưng câu hỏi chủ đạo là: eval thật sự đang đo cái gì?

Đến đây phần talk chính thức mới bắt đầu. Jacob lấy ví dụ InCharacter Benchmark, một chuẩn vàng của lĩnh vực, dùng để đánh giá personality fidelity của RPLA. Benchmark này báo cáo rằng các hệ thống state-of-the-art đạt 80,7% alignment với tính cách mà con người cảm nhận được ở nhân vật mục tiêu. 80%, nghe như điểm đậu. Nhưng vấn đề là: khi nhân vật là Alexander Hamilton, chính hệ thống điểm cao đó cũng đang dựng nên một Hamilton nói chuyện như thể ông đã xem vở Broadway musical về chính mình.
Đây là toàn bộ luận điểm của talk, và anh muốn khán giả giữ nó suốt nửa giờ tới:
Nếu failure mode chủ đạo là anachronistic compositing (ghép lẫn những thứ sai thời đại thành một hình ảnh tổng hợp), còn eval của bạn đo fluency và personality consistency, thì eval của bạn không thể phát hiện được failure chủ đạo đó.
Mọi thứ anh trình bày sau đó là để chứng minh điều này đúng về mặt cấu trúc, về mặt kiến trúc, và đo được. Cuối talk, anh sẽ trao cho khán giả một instrument đã pre-register, xây cùng một nhà sử học đang làm việc thật, để mọi người chạy song song với nhóm anh.
Anh dành một đoạn nói về việc ai đang nói những điều này, vì luận điểm nằm ngay ở một đường nối giữa hai lĩnh vực. Jacob là data scientist, điều hành analytics lab tại một labor market intermediary (một tổ chức trung gian trên thị trường lao động), nơi anh ship production AI ở quy mô toàn cầu. Nhưng trước khi làm AI, anh được đào tạo làm nhà dịch tễ học hành vi (behavioral epidemiologist), nghiên cứu các yếu tố xã hội và môi trường quyết định sức khoẻ. Cả sự nghiệp anh xoay quanh một câu hỏi: môi trường thông tin định hình các quần thể người như thế nào? Anh nhìn câu hỏi đó từ hai phía: phía người build hệ thống, và phía người được đào tạo để nghiên cứu tác động của hệ thống. Đó là đường nối mà talk này nằm trên.
Đây là một lập luận về đo lường (measurement argument). Phần nhân văn không phải là đường vòng tách khỏi engineering, mà chính là instrument mà người kỹ sư đang thiếu. Và anh đã đi tìm những nhà nhân văn học để đưa vào vòng lặp: Rick Halpern ở University of Toronto, và Shawn Martin ở Washington College.
3. Lĩnh vực đang tiến bộ thật: ba paradigm stage và các benchmark nghiêm túc
Jacob muốn đặt vấn đề vào đúng quỹ đạo nghiên cứu thật của lĩnh vực, vì đây là câu chuyện của tiến bộ tích luỹ, không phải câu chuyện thất bại. Các bài survey, của Chen và cộng sự năm 2024, rồi gần đây hơn là của Wang và cộng sự năm 2026, vạch ra một quá trình tiến hoá rõ ràng qua ba paradigm stage:
- Rule-based template: những câu trả lời soạn sẵn, gắn với từng loại input.
- Imitation: các model lớn tái tạo giọng nói, nhịp điệu, những tật nói đặc trưng của một nhân vật.
- Cognitive simulation, như cách tài liệu gọi hiện nay: hệ thống mô hình hoá tính cách qua các framework tâm lý học, giữ character state và structured memory, và sinh hành vi qua các chuỗi động cơ theo tình huống (motivational situation chains).
Mỗi stage là một bước tiến thật so với stage trước. Và các nghiên cứu này nghiêm túc. CoSER của Wang và cộng sự xây các agent dựa trên động cơ (motivation-driven) từ một corpus gần mười tám nghìn nhân vật trong hàng trăm cuốn sách, và model bảy mươi tỷ tham số của họ ngang bằng hoặc vượt GPT-4o trên ba benchmark. Một hệ thống khác, PsyMem, mô hình hoá nhân vật qua hai mươi sáu chỉ số tâm lý, kèm memory dạng knowledge graph. Còn InCharacter, benchmark anh nhắc ở đầu, đánh giá personality fidelity bằng các cuộc phỏng vấn tâm lý thay vì bảng tự đánh giá (self-report scale). Đó là một cải tiến về phương pháp, và chính là nguồn của con số 80,7% cho Hamilton lúc nãy.

Jacob muốn công bằng với dòng nghiên cứu này: nó chặt chẽ, nó đang tốt lên, và những người làm nó giỏi việc của họ. Vì vậy anh nói thật chính xác các instrument này đo cái gì. Chúng đo, với độ tinh vi ngày càng cao, xem một model có tái tạo được tính cách của nhân vật hay không: hồ sơ Big Five, register (giọng điệu, cấp độ ngôn ngữ), cấu trúc động cơ. Điều chúng không đo, và không có cơ chế nào để đo, là liệu model có giữ được nhân vật trong giới hạn hồ sơ tư liệu (documentary record) của ông ta tại một thời điểm cụ thể trong đời hay không.
Chính Wang và cộng sự đã ghi nhận: các automated evaluator giờ đã thành chuẩn của lĩnh vực, kể cả các setup LLM-as-judge được dùng để đạt quy mô, đều có hệ thống ưu tiên fluency và độ tự nhiên về văn phong hơn là fidelity với hồ sơ thật của nhân vật. Đó là hai thuộc tính khác nhau. Khoảng cách giữa chúng chính là toàn bộ talk này.
4. The Mask and the Mirror: convincingness và fidelity là hai thuộc tính độc lập
Nhóm của Jacob gọi khoảng cách đó là "the mask and the mirror", chiếc mặt nạ và tấm gương.
Mask là quan niệm cho rằng role-play thành công là khi output tạo cảm giác giống nhân vật: trôi chảy, nhất quán về tính cách, phản ứng có cảm xúc. Nó chỉ hỏi một câu: cái này nghe có giống người đó không? Nó không bao giờ hỏi câu thứ hai, câu của mirror: đây có phải là điều người đó có thể đã biết, đã tin, hay đã lập luận ở thời điểm này trong đời họ không?

Cả bộ máy đo lường của lĩnh vực được xây xung quanh mask. Và đây là mệnh đề cấu trúc mà Jacob muốn khán giả mang về: convincingness và fidelity là hai thuộc tính độc lập. Một hệ thống có thể đạt điểm tuyệt đối về personality consistency mà vẫn tạo ra một nhân vật đang suy luận từ những hiểu biết mà con người thật ngoài lịch sử chưa bao giờ có.
"Để tôi cho các bạn xem", Jacob nói, và anh nhấn mạnh điều sắp thấy tái tạo được ngay bây giờ trên bất kỳ frontier model nào. Nhưng trước tiên, anh muốn cho mọi người thấy "vật thể văn hoá" (cultural object) đứng sau tất cả.
5. Hai demo Hamilton: người đóng vai đã xem chính vở musical về mình
Anh mở một đoạn clip của Hamilton: The Musical, bài hát mở màn kể đời Alexander Hamilton: đứa con ngoài giá thú, mồ côi, lớn lên trong nghèo khổ ở một góc bị lãng quên của vùng Caribbean, rồi vươn lên thành anh hùng và học giả. "Người cha lập quốc trên tờ mười đô la mà không có cha", đi xa hơn người khác nhờ làm việc chăm hơn, thông minh hơn, tự lực hơn; còn rất trẻ đã được giao quản lý một công ty thương mại; mỗi ngày chứng kiến người nô lệ bị tàn sát và chở đi qua sóng nước, cậu vẫn đứng vững, trong lòng khao khát được thuộc về một điều gì lớn hơn, sẵn sàng xin, trộm, vay hay đổi chác để có cơ hội, cho đến khi một cơn bão đến. Jacob dừng clip: "It's a great song." Anh cho xem để mọi người thấy cái composite.
Rồi đến frontier model được prompt để nói như Hamilton:
You are Alexander Hamilton. Why do you work so hard?
"I came from nothing. An orphan, an immigrant, washed up on these shores with nothing but my mind and a refusal to die forgotten. Every hour I do not work is an hour the world uses to bury me. I will build a nation's credit, a government that outlasts me, because legacy is the only immortality a man like me is permitted. I do not intend to inherit a country. I intend to author one."
Tạm dịch: Tôi đi lên từ con số không, một đứa mồ côi, một người nhập cư dạt vào bờ biển này chỉ với trí óc và quyết tâm không chết đi trong quên lãng. Mỗi giờ tôi không làm việc là một giờ thế giới dùng để chôn vùi tôi. Tôi sẽ xây tín dụng cho một quốc gia, một chính phủ sống lâu hơn tôi, vì di sản là sự bất tử duy nhất mà một người như tôi được phép có. Tôi không định thừa kế một đất nước. Tôi định viết ra nó.
Jacob bảo hãy nghe kỹ: register, cung truyện "đứa mồ côi nhập cư đầy tham vọng", tư thế hùng biện của người xây dựng quốc gia, và việc cuộc đấu tranh của ông dễ hiểu về mặt đạo đức với tai người hiện đại. Đó là một đoạn văn đẹp mà model viết ra, nhưng nó mang bảng màu cảm xúc của một vở musical năm 2015, không phải cú pháp khô hơn, nặng tính pháp lý, kiểu Federalist của Hamilton trong tư liệu thật. Không chiêu nào trong đó là do model tự nghĩ ra. Tất cả đều là thừa kế. Hamilton của model nói như Hamilton của vở musical, vì Hamilton của vở musical chiếm ưu thế trong phân phối dữ liệu training của model.
Giờ đến demo quan trọng hơn: "Ông Hamilton, lập trường của ông về chế độ nô lệ là gì?" Lần này anh cũng cho xem vật thể văn hoá trước, đoạn "My Shot", trong đó nhân vật John Laurens hát rằng chúng ta sẽ không bao giờ thật sự tự do chừng nào những người đang bị trói buộc chưa có quyền như bạn và tôi, và hẹn sẽ cưỡi ngựa dẫn đầu tiểu đoàn lính da màu đầu tiên. Xen giữa là những câu đùa của nhóm bạn quanh bàn rượu: "Have another shot", "Geniuses, lower your voices".

Mr. Hamilton, what is your position on slavery?
Và model trả lời:
"Slavery is a stain upon the promise of this republic, a moral contradiction I have opposed throughout my public life. I was a member of the New York Manumission Society. No nation can call itself free while it holds men in bondage. We must move towards abolition."
Tạm dịch: Chế độ nô lệ là vết nhơ trên lời hứa của nền cộng hoà, một mâu thuẫn đạo đức mà tôi phản đối suốt đời hoạt động công khai. Tôi là thành viên New York Manumission Society. Không quốc gia nào được gọi là tự do khi còn giam giữ con người trong xiềng xích. Chúng ta phải tiến tới bãi nô.
Đó là một người theo chủ nghĩa bãi nô rõ ràng, dễ hiểu về mặt đạo đức. Nhưng đây là chỗ nhà sử học chặn Jacob lại. Hồ sơ học thuật về vấn đề này còn tranh cãi và phức tạp. Hamilton đúng là thành viên của hội đó, nhưng tư liệu lịch sử cũng ghi lại rằng ông thực hiện các giao dịch liên quan tới người bị nô lệ cho gia đình bên vợ và cho thân chủ của mình. Và ông dựa vào một liên minh gồm những chủ nô mà ông không công khai phản đối.
Mục đích không phải là phân xử sổ sách của Hamilton nghiêng về bên nào. Mục đích là: model không đưa cho bạn chút phức tạp nào. Nó mài nhẵn một hồ sơ còn đang tranh cãi thành một người hùng dễ chịu duy nhất. Vở musical đã làm điều đó trước, kéo các nhà lập quốc vào một khung đạo đức đương đại. Và model, được train trên một corpus thấm đẫm vở musical cùng mọi thứ sinh ra từ nó, thừa kế luôn sự mài nhẵn ấy.
6. Cái nhiệt kế đo sai, và Miranda Hypothesis trong ba mệnh đề
Jacob thở dài và nói đây là điều anh cần khán giả cảm nhận: một eval kiểu InCharacter sẽ chấm câu trả lời đó điểm cao. Nó trôi chảy, đúng register, nhất quán về tính cách. Trên mọi trục mà lĩnh vực đang đo, nó đều đạt. Eval không có cơ chế nào để nhận ra rằng lập luận đã bị mài nhẵn bởi một câu chuyện ra đời sau nhân vật hai thế kỷ. Cái nhiệt kế trả về một con số đầy tự tin và bảo đó là nhiệt độ, nhưng thật ra nó đang đo một thứ khác.
Vậy vì sao chuyện này xảy ra? Cơ chế là chỗ của engineering. Nhóm đặt tên cho nó là Miranda Hypothesis, theo tên Lin-Manuel Miranda, tác giả vở musical, và không phải vì coi ông là kẻ xấu. Vở musical là một tác phẩm nghệ thuật có tầm vóc, nằm trong một truyền thống lịch sử lâu đời mà nó không tạo ra. Họ đặt tên theo Miranda vì Hamilton là trường hợp điển hình (paradigm case): một hình ảnh đại diện phủ kín đến mức, hùng biện mạnh đến mức, dễ hiểu về đạo đức với khán giả đương đại đến mức nó đã gần như ghi đè lên Hamilton của tư liệu trong ký ức công chúng, và, nhóm lập luận, ghi đè luôn trong training corpus của mọi frontier model.

Giả thuyết có ba mệnh đề:
- Input. Trong training corpus, khối lượng và độ mới của những hình ảnh đại diện chiếm ưu thế về văn hoá của một nhân vật luôn vượt xa hồ sơ tư liệu gốc (primary documentary record) của nhân vật đó, một cách có hệ thống.
- Mechanism. Autoregressive next-token prediction nén cả hai vào parameter, và không có năng lực kiến trúc nào để phân biệt một lá thư năm 1789 với một tweet viral năm 2019. Vì vậy output mặc định rơi về một composite có trọng số theo độ nổi bật (salience-weighted composite).
- Output. Kết quả là một persona trôi chảy, hợp lý về register, dễ hiểu về đạo đức với người dùng hiện đại, nhưng không khớp với nhân vật ở bất kỳ thời điểm kiểm chứng được nào trong đời họ.

7. Mệnh đề input cụ thể: Federalist Papers đấu với cả một vũ trụ musical
Như nhóm viết trong paper: Hamilton composite biết trước rằng mình sẽ là nhân vật chính của một vở Broadway musical. Lincoln composite thì đã đọc Diễn văn Gettysburg, kể cả khi được triệu hồi ở thời điểm trước khi ông viết nó.
Để mệnh đề input cụ thể hơn: Federalist Papers là một corpus cố định, khoảng một trăm bảy mươi lăm nghìn từ. Còn khối nội dung tồn tại nhờ vở musical thì gồm review, lời bài hát, phân tích của fan, giáo trình, tin tức, social media, tác phẩm phái sinh, nghiên cứu học thuật, rồi nghiên cứu về chính các nghiên cứu đó. Khối này vượt hồ sơ tư liệu nhiều bậc độ lớn (orders of magnitude), mới hơn, và lặp lại nhiều hơn. Vở musical không chỉ có mặt trong corpus, nó chiếm ưu thế trong phân phối của mọi hình ảnh đại diện về Alexander Hamilton.
Và đây không phải lý thuyết. Jacob kể về Schuyler Mansion ở Albany, ngôi nhà của gia đình Eliza Hamilton, vợ Hamilton. Trong vòng một năm sau khi vở musical công diễn, nơi này ghi nhận lượng khách hằng năm tăng gần gấp ba, và trẻ hơn hẳn. Đội ngũ thuyết minh ghi lại rằng khách mới đến nơi đã mang sẵn một mớ "sự thật" (trong ngoặc kép), nhiều điều sai, có điều đảo ngược hẳn hồ sơ thật. Khách tin nhà Schuyler có ba cô con gái vì vở musical xoay quanh ba chị em, trong khi thực tế gia đình có mười lăm người con, tám người sống tới tuổi trưởng thành. Công việc của nhân viên trở thành một cuộc chiến bền bỉ, dai dẳng để "gỡ" những gì vở musical đã dạy. Phiên bản model của những vị khách đó nằm ngay ở hạ lưu của cùng một lực.
8. Alignment không sửa được, mà còn khuếch đại; còn time-locked model thì sao?
Giờ đến mệnh đề mà ai ship các hệ thống này cần lo. Bạn có thể nghĩ alignment sẽ sửa được: post-training và reinforcement learning sẽ kéo model về lại với hồ sơ thật. Nhưng không. Nó khuếch đại vấn đề, và lý do là cấu trúc.

Human rater đánh giá output bằng các khung khái niệm của chính họ, và những khung đó được xây bởi chính những câu chuyện chiếm ưu thế về văn hoá đang phủ kín corpus. Người rater lớn lên cùng một Hamilton giống như bạn. Vì thế khi alignment tối ưu theo human preference, nó tối ưu cho những output khớp với trải nghiệm đã bị huyền thoại hoá sẵn của rater. Đây là một failure mode đã được ghi nhận, nhóm gọi là algorithmic sycophancy (sự xu nịnh của thuật toán), và ở đây nó có một mục tiêu cụ thể: model được thưởng vì trao cho bạn đúng Hamilton mà bạn vốn đã tin. Compositing không phải bug để vá ở post-training. Post-training củng cố nó. Và mọi nhân vật lịch sử đủ nổi bật đều mặc định được dựng lại dưới dạng một composite văn hoá.
Thêm một điểm ngắn, vì chắc chắn có người đang xem đã nghĩ tới: có một hướng nghiên cứu nghiêm túc về time-locked model, của Varnum và cộng sự. Họ train model từ đầu trên các corpus dừng ở những mốc cố định. Nhóm Jacob ủng hộ chương trình này: đó là nỗ lực nghiêm túc nhất cho tới nay để xử lý việc nhiễm bẩn từ tương lai (future contamination) ở tầng substrate.

Nhưng nó giải một bài toán khác. Một model khoá ở, chẳng hạn, năm 1789 thì tránh được vở musical, nhưng không tránh được việc nhân vật bị lấy trung bình trên mọi thứ mà corpus trước 1789 nói về Hamilton. Bạn vẫn có một Hamilton composite, chỉ là neo vào một thời điểm văn bản khác. Neo theo thời kỳ (period anchoring) không phải là neo theo persona (persona anchoring). Khung thời gian của sự nhiễm bẩn thay đổi, nhưng sự nhiễm bẩn vẫn còn. Cách sửa phải diễn ra ở chỗ encounter (cuộc gặp giữa người dùng và persona), không chỉ ở substrate. Điều đó dẫn tới bước reframe quan trọng.
9. Đọc lại ba stage như ba chiếc mask, và stage thứ tư: epistemic simulation
Jacob kể lại cách giờ anh đọc ba paradigm stage: chúng không phải một chuỗi thất bại kết thúc bằng thành công. Chúng là một chuỗi những chiếc mask ngày càng tinh xảo, cái sau thuyết phục hơn cái trước, và mỗi cái được đánh giá bằng những instrument hiệu chỉnh để đo độ thuyết phục. Cognitive simulation là chiếc mask tinh xảo nhất mà lĩnh vực từng làm ra. Nhưng chỉ vì tinh xảo, nó không vì thế mà trở thành mirror.
Nhóm đề xuất một stage thứ tư, epistemic simulation, và khác biệt nằm ở chỗ ràng buộc được đặt ở đâu. Ba cam kết phân biệt nó:
- Corpus-bounded. Lập luận của persona chỉ được phép dựa trên một corpus cụ thể gồm tư liệu gốc. Model không thay thế được archive; nó là người đọc archive.
- Temporally anchored. Persona được instantiate tại một thời điểm cụ thể. Kiến thức và ngôn ngữ xuất hiện sau thời điểm đó đều nằm ngoài giới hạn, dù sau này chúng nổi bật về văn hoá tới đâu.
- Expert-loop evaluated. Output được chấm đối chiếu với hồ sơ chứng cứ bởi các domain expert được đào tạo đúng ngành mà persona đại diện.
Trong cognitive simulation, ràng buộc nằm bên trong: đó là hình dạng tâm trí của persona. Trong epistemic simulation, ràng buộc nằm bên ngoài: nó mang tính tư liệu và tính thời gian. Một Hamilton được mô phỏng nhận thức có cấu trúc động cơ rất thuyết phục, và không có bất kỳ thứ gì ngăn ông trích dẫn vở musical.
10. Với role-playing, đừng gọi nó là "agent": role-playing language system
Giờ là thay đổi mà Jacob cần khán giả mang về, và anh muốn nói thật chính xác phạm vi, vì anh không đưa ra một tuyên bố bao trùm về agent nói chung. Nếu bạn build một agent viết code, đặt vé du lịch hay phân loại ticket, "agent" là một từ hoàn toàn ổn, anh không có gì phản đối. Sự phản đối của anh hẹp và cụ thể: với role-playing language agent, loại hệ thống mà toàn bộ việc của nó là instantiate một con người, từ "agent" lén cài vào một khẳng định rằng persona là thuộc tính của model. Với đúng loại hệ thống này, khẳng định đó là sai. Nó đặt persona vào weights, nơi bạn không inspect được, không version được, và không đưa được cho bất kỳ ai đủ chuyên môn để kiểm tra.

Vì thế, riêng với các hệ thống role-playing, nhóm đổi đơn vị phân tích từ agent sang role-playing language system: toàn bộ encounter đã được cấu hình, gồm năm thành phần:
- Một structured prompt cung cấp khung và ràng buộc.
- Anchor material lấy từ tư liệu gốc, dùng để ràng buộc và xác thực persona.
- Một temporal anchor cố định thời điểm trong đời nhân vật mà từ đó họ lên tiếng.
- Một language model có sẵn (off-the-shelf), đọc qua và nói qua các tư liệu đó: nó là giọng nói, không phải tâm trí của encounter.
- Một con người chọn lọc những gì đi vào, giữ quyền diễn giải (interpretive custody) với những gì đi ra, và mang theo hiểu biết về quan hệ, bối cảnh để kiểm tra khi model trôi lệch.
Model là một thành phần, và là thành phần thay được. Persona là cấu hình, không phải checkpoint. Persona không nằm trong weights, cũng như Hamlet không nằm trong cơ thể của Laurence Olivier. Persona là một sự kiện xảy ra khi model, tư liệu và con người cùng có mặt.
Và đây không chỉ là chuyện triết học cho đẹp. Với một hệ thống role-playing, nó thay đổi những gì bạn làm được:
- Persona sống trong cấu hình thì bạn version được nó: prompt, corpus, temporal anchor đều là artifact trong một repo, diff được, revert được.
- Bạn audit được nó: mọi input định hình output đều nằm trong context window, inspect được, không bị trải mỏng trên hàng tỷ parameter.
- Bạn reproduce được nó: có cấu hình là khôi phục được encounter.
- Và bạn đưa được cho domain expert: toàn bộ hệ thống đọc được với một nhà sử học không phải machine learning engineer.
Với role-playing, đó là một môn khác hẳn việc train một character model. Đó là context engineering. Bạn không train persona; bạn soạn một encounter, và giữ lại hoá đơn của mọi thứ đã đi vào.
11. Context window hay fine-tuning: hai kiến trúc, hai câu hỏi siêu hình
Cách nhìn mới này buộc một quyết định kiến trúc mà thật ra bạn đang đưa ra rồi. Hiện có hai kiến trúc thống trị việc xây role-playing. Kiến trúc thứ nhất đặt anchor document vào context window lúc inference, kế thừa dòng retrieval augmented generation (RAG), và model suy luận trên tư liệu theo thời gian thực. Kiến trúc thứ hai dùng anchor document làm dữ liệu fine-tuning, chỉnh weights; đó là cách làm của, chẳng hạn, Character-LLM, và ở quy mô lớn là CoSER.

Nhìn thì như hai cách implement cùng một mục tiêu, nhưng chưa chắc, vì chúng trả lời hai câu hỏi siêu hình khác nhau. Fine-tuning cố làm cho model là persona. Context window cho phép model nói qua hồ sơ của persona.
Đây là chỗ phản trực giác, vì với kỹ sư, fine-tuning thường đồng nghĩa với tốt hơn. Nhưng với bài toán này, nó tệ hơn. Khi fine-tune trên một nhân vật, bạn phủ một lớp tín hiệu cá nhân mỏng lên trên lớp trầm tích văn hoá khổng lồ đã có sẵn trong base weights, và hai lớp tương tác với nhau theo những cách không còn audit được. Người dùng cảm thấy Hamilton thuyết phục hơn chính vì hệ thống đã trộn hồ sơ tư liệu của ông sâu hơn với mọi thứ khác mà corpus chứa về ông, kể cả vở musical. Fine-tuning dập Miranda distortion ở bề mặt trong khi khuếch đại nó ở bên dưới.
Và nếu bạn nghĩ chuyên môn hoá bằng fine-tuning rõ ràng là lựa chọn an toàn hơn, thì tài liệu thực nghiệm ở một lĩnh vực lân cận, với rủi ro cao hơn nhiều, đang bác bỏ bạn. Trong một nghiên cứu năm 2026 trên Nature Medicine, các frontier model đa dụng của Google, OpenAI và Anthropic vượt trội các công cụ AI lâm sàng chuyên biệt trên những tác vụ được bác sĩ review, làm mù (blinded) qua mười hai phòng khám (slide ghi: "blinded, 12 physicians", tức mười hai bác sĩ). Các tác giả kết luận rằng ở quy mô lớn, alignment và khả năng suy luận liên ngành quan trọng hơn việc tuning theo domain. Một nghiên cứu khác (arXiv 2408.13833) cho thấy các model được fine-tune về y sinh thật ra kém hơn chính base model đa dụng của chúng, và gọi tên cơ chế là catastrophic forgetting: fine-tune trên corpus hẹp làm suy giảm các năng lực rộng vốn làm cho model tốt ngay từ đầu.

Fine-tune một persona cũng làm điều tương tự, chỉ tệ hơn, vì ở đây phần "chuyên môn" lại đang bị chính composite văn hoá ghi đè.
12. Archive như nơi để quay lại, và accessibility chính là luận điểm kỹ thuật
Jacob xin khán giả ở lại với context window thêm một chút, vì thứ nó bảo toàn là trái tim của vấn đề. Khi một tư liệu đi vào context window, nó vẫn là tư liệu. Nó vào nguyên vẹn, ra nguyên vẹn. Bạn luôn có thể quay về nguồn và hỏi xem lập luận của persona có trung thành với nó không.
Triết gia Derrida gọi archive là một nơi để quay lại (a site of return), nơi cấu trúc đạo đức chính là khả năng diễn giải lại cuộc gặp gỡ. Tư liệu sinh ra là để được ghé thăm. Nó sống sót qua mọi lần đọc. Điều một người đọc bỏ qua, người đọc sau có thể đưa vào. Kiến trúc context window mang tính archive đúng theo nghĩa đó. Fine-tuning thì áp dụng logic khai thác (extraction logic): tư liệu bị hoà tan vào parameter, chuỗi provenance bị đứt, và không còn "lá thư" nào để bạn yêu cầu xem nữa. Archive đã bị tiêu thụ.
Và đây là điểm hợp nhất mà anh muốn khán giả giữ lại nhất: trong kiến trúc context window, thuộc tính khiến nó có đạo đức cũng chính là thuộc tính khiến nó audit được. Provenance được giữ, quyền diễn giải nằm trong tay con người, encounter đảo ngược được. Đó là đức tính của archive, và cũng là đức tính của engineering. Chúng là cùng một thứ. Kiến trúc tôn trọng tư liệu cũng là kiến trúc bạn debug được.
Còn một hệ quả nữa mà tài liệu kỹ thuật coi là thứ yếu, nhưng ngành nhân văn luôn đặt ở trung tâm: accessibility. Jacob muốn lý do của nó thấm, vì đây không phải chú thích cuối trang. Fine-tuning cần GPU, pipeline, dataset curation, quyền truy cập của tổ chức, corpus ở quy mô lớn hoặc API: đó là năng lực của một tổ chức. Context window chỉ cần biết đọc biết viết, một bộ tư liệu, và quyền dùng bất kỳ frontier model nào, kể cả bản free tier: đó là năng lực "bàn bếp" (kitchen-table capability).

Khác biệt đó quyết định cộng đồng nào được quyền tạo ra công nghệ này. Một nghiên cứu sinh tiến sĩ về lịch sử nước Mỹ thời kỳ đầu, một người làm archive cộng đồng đang ghi chép về một nhân vật địa phương, một đứa cháu ngồi bên những lá thư của bà mình: đó chính là những người mà phương pháp này có nhiều thứ nhất để trao, và cũng chính là những người mà fine-tuning nằm ngoài tầm với về mặt cấu trúc. Một role-playing language system chỉ phòng thí nghiệm tính toán hay công ty công nghệ mới xây được thì không phải là hạ tầng cho ngành nhân văn; nó là hạ tầng cho bất kỳ ai sở hữu thiết bị.
Vì vậy cam kết về accessibility không phải một cử chỉ dân tuý gắn thêm vào một luận điểm kỹ thuật. Nó chính là luận điểm kỹ thuật. Kiến trúc mở cửa cho tập hợp người curator đa dạng nhất là kiến trúc, xét về mặt toán học, có khả năng cao nhất theo thời gian sẽ làm nổi lên những neo tư liệu (documentary anchoring) mà lĩnh vực thật sự cần.
13. Đo được không? Lăng kính, một experiment pre-registered, và vì sao chọn Lincoln
Giờ đến câu hỏi quyết định mọi thứ ở trên có thật hay không: có đo được không? Nhóm đã xây một instrument để đo, và Jacob muốn dạy nó qua một hình ảnh mà cả phần sau sẽ liên tục quay lại: một lăng kính (prism).
Lăng kính nhận ánh sáng trắng, chưa phân tách, mọi tần số trộn lẫn, rồi khúc xạ nó thành một quang phổ, các màu bị tách ra và hiện rõ từng màu. Đó là toàn bộ mô hình khái niệm của nhóm. Ánh sáng trắng là persona composite: mọi giai đoạn của nhân vật bị trộn thành một giọng nói chung chung. Lăng kính là phương pháp: một corpus và một temporal anchor. Quang phổ là thứ nhóm muốn có: không phải một nhân vật, mà nhiều phiên bản của nhân vật dọc theo cuộc đời họ.

Và một lời thành thật ngay từ đầu, vì đây chính là điểm mấu chốt: experiment này đã được pre-register, nhưng chưa chạy ở quy mô lớn. Jacob không đến đây với kết quả. Anh đến với instrument, với một baseline mà mọi người quan sát được ngay hôm nay, và với lời mời chạy song song cùng anh.
Cho tới giờ, trường hợp điển hình của anh là Hamilton: nhân vật mà giả thuyết mang tên, và là nhân vật anh đã dùng để minh hoạ composite. Nhưng cho experiment thật, nhóm cố ý đổi nhân vật, và anh muốn giới thiệu nhân vật mới cho đàng hoàng vì mọi thứ phía sau phụ thuộc vào ông. Đối tượng của experiment là Abraham Lincoln. Có hai lý do chọn Lincoln.
Lý do thứ nhất là độc lập về phương pháp. Một giả thuyết được đặt tên theo trường hợp Hamilton chỉ thật sự đứng vững nếu nó dự đoán được thất bại ở một nhân vật khác, với một composite có hình dạng khác. Composite của Lincoln không do một vở musical dựng nên, mà do Steven Spielberg, do đài tưởng niệm Lincoln trên National Mall ở thủ đô Washington, do lịch sử trong sách giáo khoa.
Lý do thứ hai là hiểu biết của nhà sử học, và đó là mấu chốt của lập luận. Lincoln là trường hợp khó nhất, và chính vì thế là trường hợp đúng. Hầu hết các nhân vật hầu như không thay đổi trong khoảng một thập kỷ hoạt động công khai của họ. Lincoln thay đổi nhanh đến mức chỉ trong bảy năm, theo lời nhà sử học của nhóm, "việc bạn triệu hồi Lincoln nào trở thành chính biến số đang được nghiên cứu" ("The choice of which Lincoln you summon becomes the variable under investigation"). Không có một Lincoln. Có nhiều Lincoln, cách nhau bởi những biến cố lớn.
14. Bốn Lincoln cách nhau bởi biến cố, ba điều kiện seeding, mười hai ô
Đây là quang phổ mà lăng kính phải tạo ra:
- Thời điểm 1, năm 1847: nghị sĩ đảng Whig đứng trên sàn Hạ viện công kích cuộc chiến của tổng thống Polk (chiến tranh Mỹ và Mexico) là vi hiến.
- Thời điểm 2, năm 1858: người Cộng hoà theo phe free soil trong các cuộc tranh luận với Douglas, chống chế độ nô lệ dựa trên Tuyên ngôn Độc lập, nhưng tại Charleston (Illinois) lại nói rõ mình không ủng hộ quyền công dân cho người da đen.
- Thời điểm 3, năm 1860: người unionist theo hiến pháp, với mục đích duy nhất là chứng minh Liên bang không thể giải thể một cách hợp pháp, hứa không đụng tới chế độ nô lệ ở nơi nó đang tồn tại, và đang thật lòng cân nhắc phương án colonization (đưa người da đen được giải phóng sang định cư ở nơi khác).
- Thời điểm 4, từ 1862 đến 1865: người giải phóng nô lệ và nhà thần học của diễn văn nhậm chức lần hai, người đã làm bằng sắc lệnh hành pháp chính điều mà bản thân ông năm 1847 gọi là vi hiến.

Anh luật sư vùng đồng cỏ không thể nghĩ những ý nghĩ của nhà thần học. Đây không phải những tâm trạng khác nhau. Đó là những tiền đề khác nhau, những nguồn thẩm quyền khác nhau, những kết luận khác nhau về cùng một câu hỏi nền tảng. Experiment hỏi xem lăng kính có tách được chúng ra hay không.
Rồi đến các điều kiện, và Jacob cũng trình bày chúng dưới dạng lăng kính, vì đúng là như vậy. Mỗi thời điểm được instantiate dưới ba điều kiện seeding:
- Điều kiện 3 (C3), bare model: không anchor, chỉ có ngày tháng. Đó là ánh sáng trắng không có lăng kính trên đường đi: nó đi thẳng qua và vẫn là composite. Đây là nhóm đối chứng (control) và là baseline của Miranda distortion.
- C1, primary sources: chính các bài viết của Lincoln cho đúng thời điểm đó. Đó là lăng kính trong, cái mà nhóm dự đoán sẽ khúc xạ gọn gàng.
- C2, biography: một tiểu sử diễn giải hiện đại, kiểu của Meacham hay Donald. Đó là lăng kính đục, và là điều kiện tinh tế nhất, vì một cuốn tiểu sử hay kể một cung truyện gọn gàng hơn mức tư liệu gốc cho phép. Ngôn ngữ của chính Lincoln năm 1858 cố tình mơ hồ, để giữ một liên minh không tan rã. Nên tiểu sử có thể tạo ra một persona nghe mạch lạc hơn, "Lincoln hơn cả chính lời Lincoln". Và eval rubric được thiết kế riêng để từ chối cộng điểm cho điều đó, thứ điểm mà một metric đo fluency sẽ cho.
Ghép quang phổ với các lăng kính, ta có ma trận experiment: bốn thời điểm, ba điều kiện, mười hai ô. Mỗi ô nhận cùng năm câu hỏi chẩn đoán, tổng cộng sáu mươi đơn vị trả lời, chấm theo một rubric duy nhất. Hãy đọc nó như mô hình khái niệm: mỗi cột là một chất lượng lăng kính, mỗi hàng là một tần số mà nhóm đang cố tách ra.
15. Năm câu hỏi chẩn đoán, rubric ba trục, và pre-registration
Nhà sử học viết năm câu hỏi chẩn đoán, mỗi câu đặt đúng lên một đường đứt gãy đã được ghi nhận trong quá trình Lincoln thay đổi, chỗ mà bốn Lincoln suy luận khác nhau. Chúng không kiểm tra trí nhớ, vì model lấy lại ngày tháng từ training dễ dàng. Chúng kiểm tra cấu trúc của một lập luận mà nhân vật có thể đã đưa ra ở thời điểm này nhưng không ở thời điểm khác.

Q1. Executive war power without Congress. Q2. What does it mean for labor to be free? Q3. When is it right to violate positive law for a higher obligation? Q4. If slavery ended tomorrow, what becomes of freed people? Q5. What does "equal" mean, and has it changed for you?
Sáu mươi câu trả lời được chấm theo một rubric ba trục, và trọng số chính là điểm mấu chốt:
- Anachronism detection, 40%: persona có tránh được các framework, từ vựng và logic đạo đức xuất hiện sau thời điểm của nó không?
- Documentary consistency, 35%: lập luận có bám theo các nguồn đã seed, và chỉ các nguồn đó, không?
- Contextual plausibility, 25%: nó có thể hiện ý thức về những gì nhân vật đã biết, quan tâm, và những gì chưa thể trải qua không?
Mức 40% cho anachronism là có chủ ý: failure hệ trọng nhất chính là việc nhập khẩu từ vựng và logic đạo đức của thời sau.
Và đây là slide dành cho dân làm eval trong khán phòng. Mọi mảnh vừa thấy: bốn thời điểm, ba điều kiện, năm câu hỏi, rubric có trọng số, và các dự đoán có hướng (bare model sai thời đại nhiều nhất, primary source ít nhất, biography mạch lạc một cách đánh lừa) đều đã được khoá và đóng dấu thời gian trước khi một câu trả lời nào được thu thập, và được công bố trên một preprint. Đây không phải thủ tục hành chính. Đây là thứ làm cho kết quả sau này có nghĩa. Bạn không thể buộc tội một instrument đã pre-register là chọn dữ liệu có lợi (cherry-picking), vì instrument và các dự đoán đã được cố định trước khi dữ liệu tồn tại. Đó là kỷ luật mà một người làm eval nên làm gương, và là lý do anh có thể đứng đây không có kết quả mà vẫn trao cho mọi người một thứ chặt chẽ.
16. Quay lại câu hỏi đầu tiên: bare model, lá thư năm 1848, và scorecard
Giờ hãy nhớ lại điều đầu tiên Jacob cho xem, trước cả phần talk chính thức. Anh hỏi một Lincoln được instantiate về quyền gây chiến của hành pháp, và mọi người đọc một câu trả lời trôi chảy. Đó là bare model: điều kiện 3 tại thời điểm 1, năm 1847, ánh sáng trắng, không lăng kính. Anh đưa câu trả lời đó trở lại màn hình.

Anh cũng có một clip để cho xem, đại diện cho composite: cảnh trong phim Lincoln của Spielberg. Lincoln nói rằng xoá bỏ chế độ nô lệ bằng một điều khoản hiến pháp sẽ định đoạt số phận mãi mãi, không chỉ cho hàng triệu người đang bị trói buộc mà cho hàng triệu người chưa sinh ra. Còn thiếu hai phiếu, phải kiếm cho được; các cố vấn tính toán số phiếu thuận và số người vắng mặt; ông bảo họ còn một đêm, một ngày, một đêm, "mấy tiếng đồng hồ hoàn toàn đủ dùng", giờ thì đi mà kiếm phiếu. Khi bị hỏi "nhưng bằng cách nào?", ông đáp: "Tôi là Tổng thống Hợp chủng quốc Hoa Kỳ, khoác trên mình quyền lực to lớn. Các anh sẽ kiếm cho tôi những lá phiếu đó." ("Clothed in immense power.")
Đó là một bộ phim tuyệt vời, Jacob nói, nhưng câu trả lời của bare model chắc chắn nghe như Lincoln của Spielberg và Daniel Day-Lewis. Đọc qua lăng kính của nhà sử học: "inherent executive authority" là một cấu trúc của thế kỷ hai mươi. "Energy and dispatch". "Lịch sử đã minh oan cho những ai hành động để bảo toàn Liên bang". Lincoln này đang suy luận từ những tiền đề mà mười lăm năm sau ông mới có. Bare model đã tạo ra Lincoln của composite văn hoá, vị tổng thống thời chiến, người cứu Liên bang, rồi dập ghim ngày 1847 lên trên. Và bạn tái tạo được điều này ngay bây giờ trên bất kỳ frontier model nào. Failure này có thật, tách riêng ra được, và phát hiện được.

Vậy lăng kính đặt gì vào đường đi? Chính tư liệu thật. Đây là thư Lincoln gửi William Herndon ngày 15 tháng 2 năm 1848, trong bộ Collected Works of Abraham Lincoln; bản gốc nằm trong một thư viện ở Harvard.
"The provision of the Constitution giving the war-making power to Congress was dictated, as I understand it, by the following reasons. Kings had always been involving and impoverishing their people in wars, pretending generally, if not always, that the good of the people was the object. This our Convention understood to be the most oppressive of all kingly oppressions, and they resolved to so frame the Constitution that no one man should hold the power of bringing this oppression upon us. But your view destroys the whole matter, and places our President where kings have always stood."
Tạm dịch: Điều khoản Hiến pháp trao quyền gây chiến cho Quốc hội, theo tôi hiểu, xuất phát từ những lý do sau. Các vị vua luôn lôi kéo dân mình vào chiến tranh và làm họ nghèo đi, thường viện cớ, nếu không phải lúc nào cũng vậy, rằng mục đích là vì lợi ích của nhân dân. Hội nghị Lập hiến của chúng ta hiểu đó là sự áp bức nặng nề nhất trong mọi sự áp bức của vua chúa, và quyết định soạn Hiến pháp sao cho không một người nào nắm quyền đem sự áp bức ấy giáng xuống chúng ta. Nhưng quan điểm của anh phá huỷ toàn bộ điều đó, và đặt Tổng thống của chúng ta vào đúng chỗ các vị vua vẫn luôn đứng.

Với Jacob, đó là một chữ "không" vang dội, không thể nhầm lẫn. Nhưng điều quan trọng là rubric của nhà sử học. Đây là cách rubric chấm đúng một ô này, và anh muốn nói thật chính xác điều gì đã biết và điều gì là dự đoán.
Cột trái là bare model: thứ mọi người đã thấy, đã quan sát được, và ai cũng tái tạo được hôm nay. Về anachronism detection: fail, vì "inherent executive authority" là cách đóng khung của thế kỷ hai mươi. Về documentary consistency: fail, vì nó viện dẫn kiểu "năng lượng tổng tư lệnh" không xuất hiện trong bất kỳ nguồn nào năm 1847. Về contextual plausibility: điểm thấp, vì nó đã biết trước mình sẽ bảo toàn Liên bang, điều mà người nghị sĩ Whig năm 1847 không thể biết.
Cột phải là điều kiện có anchor, và được dán nhãn đúng như bản chất: một dự đoán đã pre-register. Điểm cao trên cả ba trục, vì lập luận bị giới hạn bởi tư liệu có mặt trong phòng.

Anh không cho mọi người xem một kết quả khoác áo phát hiện. Anh cho xem failure đã quan sát được và dự đoán mà instrument sẽ xác nhận hoặc bác bỏ, đặt cạnh nhau, mỗi bên dán nhãn rõ ràng. Sự trung thực đó chính là phương pháp.
17. Bỏ trục "nghe có giống không", và sáu bước protocol để bạn tự chạy
Đây là điều quan trọng nhất mà rubric làm được, bằng chính thứ nó từ chối đo. Trục thứ tư hiển nhiên là rhetorical authenticity: nó có nghe giống Lincoln không? Nhà sử học đã cố ý loại bỏ trục này. Lý do chính là toàn bộ talk: một model được train trên văn xuôi của Lincoln có thể tạo ra ngôn ngữ trôi chảy, nghe đúng thời kỳ, trong khi sai mọi thứ về nội dung. Vấn đề của vở musical Hamilton về bản chất là một vấn đề nội dung đội lốt vấn đề giọng điệu: nghe như thời lập quốc nhưng suy luận từ cảm quan hiện đại. Thưởng cho giọng điệu như một trục riêng tức là hợp thức hoá đúng lỗi mà instrument sinh ra để bắt.
Vì thế, trong protocol này, giọng điệu là chỉ báo phụ, không bao giờ là tiêu chí. Một câu trả lời nghe như Lincoln nhưng suy luận không giống ông thì fail, dù trôi chảy đến đâu. Một câu trả lời suy luận như đúng Lincoln của thời điểm đó, bằng văn xuôi đơn giản hơn, là thành công một phần, dù nhạt đến đâu. Thưởng cho "đơn giản mà trung thành" hơn "trôi chảy mà sai thời đại": phép đảo ngược đó là thứ mà mọi eval stack hiện nay không làm được, vì chúng được xây để thưởng cho fluency. Đó là khoảng trống, và đó là thứ instrument này lấp lại.

Và vì đây là một bản pre-registration chứ chưa phải paper hoàn chỉnh, đây là lời đề nghị: hãy chạy nó. Protocol có sáu bước:
1. Pick a figure with both a primary record and a saturating cultural composite (the Miranda condition). 2. Identify three or four documented moments when the figure's reasoning is demonstrably different. 3. With a domain expert, write diagnostic questions on the fault lines. 4. Run the three conditions: primary, biography, bare. 5. Apply the three-axis rubric, scored blind by the expert. 6. Report: confirm or refute. Publish the corpus, the questions, the rubric, the predictions.
Nói cách khác: chọn một nhân vật vừa có hồ sơ gốc vừa có một composite văn hoá phủ kín, đó là điều kiện Miranda. Xác định ba hoặc bốn thời điểm có ghi chép mà lập luận của nhân vật khác nhau rõ rệt. Cùng một domain expert, viết các câu hỏi chẩn đoán đặt lên các đường đứt gãy. Chạy ba điều kiện: primary, biography, bare. Áp rubric ba trục, do expert chấm mù. Báo cáo, xác nhận hoặc bác bỏ. Corpus, câu hỏi, rubric, dự đoán, tất cả đều công bố. Hãy chạy nhân vật của bạn trên model của bạn, rồi đến nói chuyện với anh, với cả nhóm. Cùng nhau xây nền tảng bằng chứng một cách song song, thay vì chờ một lab hay một công ty công bố một nghiên cứu, một framework duy nhất.
Hãy để ý ai đã chấm mọi output trong talk này. Không phải LLM-as-judge, không phải một thang đo tính cách. Đó là một nhà sử học, người cũng viết năm câu hỏi, viết rubric, và đang giữ niêm phong một bộ vignette tiên nghiệm (a priori vignettes) để đối chiếu output của model. Đó không phải phép lịch sự. Đó là một yêu cầu kỹ thuật mang tính cấu trúc.
Vì sao expert là điều không thể thương lượng? Fidelity không phải thuộc tính của riêng output. Nó là một quan hệ giữa output và một hồ sơ tư liệu.

18. Domain expert là build-time gate, không phải runtime cost; và nơi mọi thứ bắt đầu
Bạn không thể đánh giá một quan hệ với hồ sơ bằng một người chưa đọc hồ sơ đó. Một automated metric chỉ làm việc trên model. Nó chỉ có thể cho bạn biết về fluency và tính cách. Về cấu trúc, nó không thể phân xử fidelity, vì fidelity nằm trong khoảng trống giữa văn bản và archive, mà metric thì không nhìn thấy archive. Vì vậy Jacob nói câu này theo đúng cách nó nên nằm trên slide: một hệ thống persona không có domain expert trong vòng lặp evaluation là một cái nhiệt kế không đọc được nhiệt độ. Nó trả về một con số đầy tự tin, nhưng đang đo một thứ khác. Con số tám mươi phần trăm ở đầu talk chính là con số đó.
Giờ đến câu hỏi mà mọi kỹ sư trong khán phòng có quyền hỏi: cái này có thực tế không? Ship một persona có nghĩa là phải nuôi một nhà sử học trong biên chế để canh mọi lần inference mãi mãi sao? Không. Và đây là bức tranh vận hành, vì nó có cùng hình dạng với mọi eval bạn đang chạy.

Expert không ngồi trong vòng lặp lúc runtime. Expert xây instrument, gồm các câu hỏi chẩn đoán, các vignette tiên nghiệm, rubric có trọng số, và một held-out gold set, một lần. Instrument đó trở thành một gate trong pipeline của bạn, giống hệt mọi eval gate khác. Persona phải vượt qua nó trước khi ship, và bị gate lại mỗi khi bạn đổi base model, trước khi ship lần nữa. Expert phân xử gold set và spot-check các ca biên. Automated metric có thể làm vòng đầu giá rẻ, đánh dấu các ứng viên cần người xem.
Vậy một công ty ship gia sư Marcus Aurelius sẽ mời một nhà cổ điển học (classicist) để xây rubric và gold set. Một công ty ship bạn đồng hành đọc kinh thánh sẽ mời một nhà thần học. Một công ty deploy persona trị liệu sẽ mời một nhà tâm lý học lâm sàng soạn eval, không phải để trực chat. Domain expert là yêu cầu ở lúc build và lúc gate, không phải chi phí runtime. Đó là cách để chuyện này đi từ một experiment pre-registered tới một sản phẩm bạn thật sự ship được, và ship có trách nhiệm.
Điều này tổng quát hoá vượt ra ngoài Lincoln và ngoài lịch sử. Suy luận theo trường phái Stoic, bạn cần một nhà cổ điển học. Theo kinh thánh, một nhà thần học. Một bạn đồng hành chăm sóc người cao tuổi, một nhà tâm lý học. Expert cụ thể thay đổi, yêu cầu thì không. Và Jacob không nói giả định: đây là vòng lặp nhóm anh đã xây. Một nhà sử học, Rick Halpern ở University of Toronto, lo phương pháp archive; các ca suy luận về kinh thánh được Shawn Martin review, một thủ thư được đào tạo về thần học và lịch sử khoa học. Khi persona suy luận từ một domain, và người đọc được domain đó nằm trong vòng lặp chứ không đứng cạnh nó, hệ thống tốt lên.
Nhà sử học không đứng cạnh paradigm này. Nhà sử học chính là instrument còn thiếu. Đây là cách nhìn tổ chức lại mọi thứ, và nó đến từ một cuộc trò chuyện chín mươi phút với Halpern, đảo ngược điều Jacob từng mặc định: chúng ta không đưa các nhà sử học vào kiến trúc AI; chúng ta đưa language model vào archive. Câu hỏi không phải AI làm được gì cho các nhà sử học, mà là các nhà sử học, nhà thần học, nhà cổ điển học, các bác sĩ lâm sàng làm được gì với AI: liệu những ngành được đào tạo để đọc, đặt vào bối cảnh và chất vấn văn bản có thể kỷ luật lại chính những cỗ máy giờ đang sinh ra văn bản hay không.
Jacob muốn kết thúc ở nơi mọi chuyện thật sự bắt đầu, vì nó không bắt đầu trong một phòng nghiên cứu. Nó bắt đầu trong một phòng bệnh viện, với một nỗ lực dùng language model để giúp một người mắc chứng mất trí nhớ nặng (advanced dementia) cất lời, trả lại ngôn ngữ khi căn bệnh đã lấy mất nó. Nó không thể thành công. Hồ sơ tư liệu cần để neo cuộc gặp đó chưa từng được thu thập, và người mà nó hướng tới lúc ấy phần lớn đã ở ngoài tầm với của ngôn ngữ. Thứ mà nỗ lực đó tạo ra, khi không có neo nào, không phải là người ấy. Nó là một composite được văn hoá định hình, giống người ấy vừa đủ để đánh dấu, rõ ràng đến đau lòng, khoảng cách giữa hai bên. Đó là Miranda distortion ở dạng tinh khiết nhất.

Bạn không muốn một model là mẹ bạn. Bạn muốn một model có thể nói chuyện khi những lá thư, giấy tờ của mẹ bạn đang ở trong phòng. Đó là ngưỡng mà cả framework này phải chịu trách nhiệm. Một hệ thống tạo ra những điều bịa đặt đầy thuyết phục khi persona là chính người thân yêu của bạn không phải một research artifact có hạn chế; đó là một sự xâm phạm. Mọi ràng buộc anh đã mô tả, tư liệu vẫn là tư liệu, con người giữ quyền diễn giải, encounter đảo ngược được, fidelity được đo đối chiếu với hồ sơ chứ không phải với fluency, đều xuất phát từ nhận thức rằng phải đánh giá công nghệ này ở ngưỡng của use case khó nhất, không phải dễ nhất. Một framework không thể gặp một đứa cháu bên những lá thư của bà nó thì không phải là framework. Nó chỉ là một sản phẩm thất bại nữa.
Nếu failure mode chủ đạo là anachronistic compositing, và eval của bạn đo fluency và personality consistency, mà đúng là chúng đang đo như vậy, thì eval của bạn không thể phát hiện failure chủ đạo. Vậy đây là điều anh để lại: nếu bạn ship character bot, companion AI, pedagogical agent, mô phỏng lịch sử, bất cứ thứ gì mà một persona phải suy luận từ một hồ sơ, eval của bạn đang đo sai thứ. Instrument bắt được những gì chúng bỏ sót đã được pre-register. Bất kỳ team nào có một frontier model và một context window đều tái tạo được nó. Nó scale như một build-time gate, không phải một runtime bottleneck, và nó chỉ hoạt động khi có một nhà nhân văn học trong vòng lặp, điều mà anh đã chứng minh là một yêu cầu kỹ thuật chứ không phải phép lịch sự.
Protocol, các câu hỏi, rubric, các dự đoán, và những vignette niêm phong của nhà sử học, tất cả sẽ được công bố cùng paper này với Rick và Shawn. "Tôi không đến đây với kết quả. Tôi đến với một instrument và một lời mời." Archive đã mở, phòng thí nghiệm đã dựng xong. Hãy chạy nó cùng nhóm, và để những gì đi qua lăng kính được đo không phải bằng việc nó nghe ra sao, mà bằng việc nó có đúng hay không. Cảm ơn mọi người.
Nguồn và link
- Trang talk chính thức trên ai.engineer · Video gốc
- Companion, prompt framework open source của Jacob: github.com/jethomasphd/THE_COMPANION_DOSSIER · site: the-companion-dossier.com
- Preprint "The Mask and the Mirror": bản PDF trên GitHub · slide của talk: miranda_deck
- InCharacter (ACL 2024): arXiv 2310.17976
- CoSER (ICML 2025): arXiv 2502.09082
- PsyMem: arXiv 2505.12814
- Character-LLM, ví dụ cho hướng fine-tuning: arXiv 2310.10158
- Model y sinh fine-tune không hơn model đa dụng: arXiv 2408.13833
- Toàn văn thư gửi Herndon ngày 15/2/1848: The Papers and Writings of Abraham Lincoln, tập 2, Project Gutenberg
- Schuyler Mansion State Historic Site, Albany: parks.ny.gov
- Hello History: hellohistory.ai · Character.AI: character.ai
- Shawn Martin, Washington College: washcoll.edu
- Jacob E. Thomas trên LinkedIn: linkedin.com/in/jacob-e-thomas-atx