Homus
‹ All talks

The Prompt Is Still a Punch Card

AI Engineer World's Fair 2026: Online Track · Video gốc

Prompt vẫn là protocol batch của punch card: channel, expression, protocol, và vì sao giao diện AI phải tham gia vào hội thoại thay vì chờ Submit.

AI UXAgents

1. Gõ vào một cái hộp nhỏ rồi chờ

Ted mở đầu bằng một cảnh mà anh chắc rằng phần lớn người xem đã làm trong vài giờ vừa qua. Bạn gõ một yêu cầu vào một cái hộp nhỏ, gửi cho một siêu trí tuệ, rồi bạn chờ. Bạn nhìn con trỏ nhấp nháy. Có thể một cái throbber nhỏ xoay vòng qua những gerund tinh nghịch như "hullabalooing", "tomfoolering", "philosophizing" để che đi khoảng chờ. Có thể nó cho bạn đúng thứ bạn muốn, cũng có thể bạn diễn đạt lại rồi thử lần nữa. Tất cả đều có cảm giác hoàn toàn bình thường.

Mục tiêu của anh trong hai mươi phút tới là làm cho việc viết prompt trở nên xa lạ và kỳ quặc trở lại.

Slide tiêu đề The Prompt Is Still a Punch Card với logo joinin.ai
Slide tiêu đề "The Prompt Is Still a Punch Card", dòng phụ "Make the familiar strange, then earn the room": làm cho thứ quen thuộc trở nên lạ, rồi mới giành được sự chú ý của khán phòng.

Ted Johnson là co-founder của JoinIn AI. Trong sự nghiệp hai mươi lăm năm xây enterprise software, hệ thống collaboration và các giao diện có AI, anh luôn tập trung vào tương tác của con người. Anh cũng theo dõi AI suốt hai thập kỷ, kể cả từ thời GPT-1 và GPT-2, những model kém ấn tượng hơn nhiều.

Khi ChatGPT xuất hiện, anh cảm thấy hai điều cùng lúc. Điều thứ nhất, không có gì bất ngờ: kinh ngạc, vì biết thế giới sẽ không bao giờ như cũ nữa. Điều thứ hai thì bất ngờ thật: một nỗi thất vọng mà anh không rũ bỏ được. Nỗi thất vọng ấy biến thành một nhận xét, nhận xét đó đã khai sinh ra một công ty là JoinIn AI, và anh cứ quay lại với nó mãi: tại sao chúng ta vẫn phải học cách dùng AI? Tại sao một thứ mạnh đến vậy lại thường có cảm giác không tự nhiên khi dùng?

2. Lộ trình: channel, expression, protocol

Để trả lời câu hỏi đó, Ted vạch ra con đường của talk. Đầu tiên, anh lấy giao diện máy tính quen thuộc nhất và làm nó lạ đi. Sau đó anh đưa ra ba khái niệm chính:

  • Channel: kênh vật lý mang ý định của bạn đi.
  • Expression: biên độ và độ phong phú của ý nghĩa mà channel đó có thể mang.
  • Protocol: hình dạng, hay luật lệ, của cuộc trao đổi.

Anh sẽ dùng ba khái niệm này để cho thấy prompt chính là cái punch card của thời nay. Rồi anh chia sẻ vài ví dụ về cách giao diện có thể tiến lên, và kết bằng vài lời khuyên thực tế cho AI và human-centered design.

Channel kênh vật lý mang ý định đi Expression biên độ ý nghĩa channel mang được Protocol hình dạng, luật lệ của cuộc trao đổi
Ba lăng kính Ted dùng suốt talk. Channel là thứ chở tín hiệu, expression là lượng ý nghĩa đi qua được, protocol là luật của cuộc trao đổi.

3. Bàn phím không hề tự nhiên

Ai cũng biết thứ này: bàn phím. Nó có mặt ở khắp nơi và cho cảm giác hoàn toàn bình thường, tự nhiên. Nhưng nó không tự nhiên. Tất cả chúng ta đều phải đi học. Tất cả đều phải luyện tập.

Ted nói anh là người yêu bàn phím, nhưng có vẻ như người ta đã cố sửa bàn phím từ chừng nào nó còn tồn tại. Có người thử những layout hiệu quả hơn như Dvorak hay Colemak để tiết kiệm công cho ngón tay. Một ví dụ cực đoan hơn: có những người mê bàn phím không chịu lãng phí ngón cái cho phím space, nên họ gắn cho ngón cái hiệu quả đó bốn, tám, thậm chí mười phím để bấm.

Ba heatmap bàn phím QWERTY, Dvorak và Colemak
Heatmap lực gõ trên ba layout: QWERTY ở trên, các điểm nóng rải rác lên hàng trên; Dvorak và Colemak ở dưới, điểm nóng dồn về hàng giữa (home row), tức ngón tay phải di chuyển ít hơn.

Và "bàn phím" thực ra là gì? Ted đưa ra bản vẽ bằng sáng chế của layout mà chúng ta dùng mỗi ngày. Theo Ted, bằng sáng chế này có từ khoảng năm 1860. Còn món anh thích nhất: thứ chúng ta dùng hôm nay cũng hoàn toàn có thể đã là Hansen Writing Ball, một cỗ máy trông chẳng giống chút nào với cách bạn muốn nói chuyện với một siêu trí tuệ.

Hansen Writing Ball, một máy đánh chữ hình bán cầu bằng đồng
Hansen Writing Ball, nhãn trên slide ghi năm 1870: các phím xếp trên một bán cầu bằng đồng. Một nhánh lịch sử khác của "bàn phím" mà lẽ ra cũng có thể đã thắng.

Chúng ta mang theo di sản của một thiết bị nhập liệu tuỳ tiện, được thiết kế dưới những ràng buộc đã không còn tồn tại từ một thế kỷ nay, và đặt nó vào giữa bản thân mình với những cỗ máy có năng lực nhất từng được tạo ra. Không ai đang sống chọn nó cả. Tất cả chúng ta thừa hưởng nó, rồi thôi không để ý tới nó nữa.

4. Ý thứ nhất: channel

Đó là ý đầu tiên: channel, phương tiện mà một giao diện cho bạn để làm việc. Bàn phím là một channel. Microphone là một channel. Màn hình, punch card, prompt box: tất cả đều là channel.

Channel quan trọng vì mỗi channel có thể mang về mặt vật lý một loại tín hiệu khác nhau. Ví dụ, text là một dòng ký hiệu rời rạc. Giọng nói có thể mang timing, cao độ, sự ngập ngừng, cùng với chữ. Một diagram có thể mang quan hệ không gian, tất cả cùng một lúc. Nhưng đây là khác biệt về thứ mà phương tiện có thể truyền đi, tức bandwidth của nó, chứ không phải khác biệt về ý nghĩa. Và mang được nhiều tín hiệu hơn không có nghĩa là máy hiểu được chút nào trong đó. Đó là một câu hỏi riêng, và đó là ý tiếp theo.

Text dòng ký hiệu rời rạc Voice timing, cao độ, ngập ngừng + chữ Diagram quan hệ không gian, cùng một lúc
Khác biệt giữa các channel là bandwidth, tức thứ phương tiện truyền được, chứ chưa phải việc máy hiểu được bao nhiêu.

Con người dùng tất cả những channel này liên tục mà không cần nghĩ. Chúng ta không bao giờ chọn một channel rồi ép mọi thứ đi qua nó. Làm vậy thì thật vô lý. Vậy mà đó chính là điều chúng ta bắt người dùng làm với máy móc, hết lần này tới lần khác.

Hãy giữ lấy chữ channel, vì đây là cú twist: với AI, channel thật ra chưa bao giờ thay đổi. Bạn vẫn đang gõ vào một cái hộp. Nhưng thứ bạn được phép đẩy qua cái hộp đó thì sắp thay đổi.

5. Ý thứ hai: expression

Lần đầu tiên, channel của máy tính mang được ngôn ngữ con người đầy đủ và phong phú. Ted nhấn mạnh: anh nói là thứ nó mang, không phải thứ nó là. Bạn vẫn đang gõ vào một cái hộp. Bạn vẫn bấm nút Submit. Bàn phím không thay đổi. Thứ được cải thiện là biên độ của những gì bạn được phép diễn đạt qua nó.

Đó là ý thứ hai: expression, bao nhiêu phần trong những gì bạn thật sự muốn truyền đạt, thật sự muốn nói, sẽ được giao diện cho đi qua.

Ted đưa ví dụ về tiến trình của expression trên máy tính theo thời gian. Bắt đầu với assembly, cho bạn một instruction set, vài chục opcode. Rồi tới command trong shell, với input và flag. Rồi các ngôn ngữ lập trình hiện đại cho bạn những primitive có thể compose lại với nhau. Từng bước một, mỗi thứ đều mạnh, nhưng mỗi thứ là một bộ từ vựng cố định, buộc bạn diễn đạt ý định bằng cách chọn trong một menu những gì máy chấp nhận.

Ngôn ngữ tự nhiên đã phá tung cái menu đó. Lần đầu tiên, bạn có thể nói gần như bất cứ điều gì theo cách bạn sẽ nói với một người khác. Và trên trục expression, bước nhảy này là thật và khổng lồ. Có cả một đại dương ý nghĩa trong một yêu cầu bình thường của con người: context, sắc thái, ý định, tất cả những thứ chúng ta chưa bao giờ phải nói rõ ra với nhau. Lần đầu tiên, bạn có thể nói gần như mọi điều như với một con người, và lần đầu tiên, một cỗ máy có thể tiếp nhận nó.

Vậy đây là điều nên khiến chúng ta, những engineer và designer, thấy khó chịu, như nó đã làm Ted khó chịu và cũng truyền cảm hứng cho anh: channel của máy tính đã giữ nguyên suốt mười lăm năm, có cái tới một trăm tám mươi năm. Giờ đây, với AI, chúng ta đổ cả một đại dương expression vào đó. Vậy tại sao cảm giác vẫn như đang hút qua một cái ống hút, và vẫn vật lộn để học xem AI suy nghĩ thế nào?

Hình minh hoạ một ô prompt nối bằng ống hút vào đại dương, phía trên là các biểu tượng giọng nói, màn hình, người, đồng hồ, tài liệu, tạm dừng
"Just a straw into the ocean": ô prompt "Tell me what matters." chỉ là một cái ống hút cắm xuống đại dương. Phía trên mặt nước là những thứ prompt không mang theo được: giọng nói, màn hình, con người, thời gian, tài liệu, khoảng dừng.

6. Ý thứ ba: protocol, và protocol đó là batch

Lý do là có một ý thứ ba nằm bên dưới hai ý kia, và đây thật sự là thứ chưa theo kịp: protocol, những luật bạn tuân theo, và hình dạng của chính cuộc tương tác.

Channel giữ nguyên. Expression bùng nổ trong ba năm qua cùng LLM. Nhưng protocol, tức là prompting, là protocol của một punch card, và protocol của punch card chính là batch kiểu cũ.

Ted kể lại punch card batch nghĩa là gì. Bạn ngồi xuống, ở xa cỗ máy, mã hoá cẩn thận toàn bộ yêu cầu từ trước, mang xấp thẻ tới cho người vận hành, submit job, rồi chờ. Có khi hàng giờ, có khi qua đêm. Sau đó bạn đọc bản in ra, thấy một chỗ sai, sửa nó, submit lại, rồi lại chờ. Cỗ máy không bao giờ tương tác với bạn trong lúc bạn đang suy nghĩ. Nó chỉ làm việc với gói đã hoàn chỉnh, sau khi mọi chuyện đã xong.

Giờ nhìn sang prompt. Lắp ráp toàn bộ yêu cầu, submit, chờ, đọc thứ trả về. Có gì đó lệch, lắp ráp lại, submit lại, rồi chờ.

Punch card mã hoá xấp thẻ submit job chờ hàng giờ đọc bản in, sửa Prompt lắp ráp yêu cầu bấm Submit chờ vài giây đọc, thấy lệch
Cùng một protocol: đóng gói trọn vẹn, submit, chờ, đọc, làm lại. Thứ duy nhất ngắn đi là thời gian chờ.

Ted thừa nhận có những tính năng tương tác đang cải thiện điều này. Bạn có thể hỏi cập nhật. Bạn có thể yêu cầu tóm tắt những gì đã làm. Nhưng rốt cuộc, nó vẫn là batch rắc thêm chút tương tác. Vẫn là cùng một protocol. Chúng ta rút thời gian chờ từ qua đêm xuống vài giây hay vài phút, và tốc độ đó đánh lừa chúng ta rằng nó đã trở nên tương tác. Không phải vậy. Nó vẫn là batch. Bạn vẫn phải đóng gói trọn một lượt trước khi máy được phép tham gia.

Chúng ta học các mẹo, chia sẻ tip, dùng skill, hay viết lại prompt theo một cách nhất định để xoay xở với chuyện này. Và nói thay vì gõ cũng không thay đổi được gì.

7. Prompt engineering là nghệ thuật đóng gói batch

Giọng nói của bạn chỉ được chuyển thành chữ, đổ vào cái hộp, rồi submit. Batch ngắn hơn thì vẫn là batch, vì protocol là phần không hề tiến lên. Protocol chính là phần mà chúng ta đã phải học.

Chúng ta chỉ đặt cho nó một cái tên nghe sang trọng. Chúng ta gọi nó là prompt engineering và coi đó là một kỹ năng của power user. Bóc cái nhãn ra thì nó là một bộ luật để đóng gói batch kiểu cũ. Ví dụ: bảo nó nghĩ từng bước một. Đưa cho nó ví dụ. Bảo nó đóng vai chuyên gia. Đừng bảo nó đóng vai chuyên gia. Đừng hỏi nó theo cách đó. Dán thêm context. Dán bớt context. Chỉ nói chuyện với nó qua tài liệu markdown.

Slide Packaging a good batch liệt kê các mẹo prompt
"Packaging a good batch": "Tell it to think step by step." "Give it examples." "Ask it to be an expert." "Don't ask it that way." "Paste more context." Và dòng cuối, ngược lại dòng trước: "Actually, paste less context."

Chúng ta trao đổi với nhau những câu thần chú. Chúng ta đã học được những từ ngữ ma thuật. Đó là ảo giác. Nó cho cảm giác như đã thành thạo, nhưng đó là cùng một kiểu thành thạo mà người vận hành punch card từng có: biết chính xác cách sắp xấp thẻ để job không bị lỗi.

Hơn nữa, chúng ta đã trở nên giỏi viết prompt cho những chiếc hộp đen này, và chính điều đó mới là thứ nên khiến chúng ta bận tâm, chứ không phải yên lòng.

Ô prompt Explain it like I'm five nối vào một khối hộp đen ghi AI
"Black box. Big po..." (chữ bị cắt ở mép khung): ô prompt "Explain it like I'm five." nối thẳng vào một khối hộp đen ghi chữ AI. Người dùng chỉ thấy cái hộp, không thấy bên trong.

Không điều gì trong số này có nghĩa là prompt tệ. Punch card không tệ. Command line không tệ. Chúng là những giải pháp xuất sắc cho các ràng buộc của thời đại mình. Nhưng đó chính là toàn bộ câu hỏi: batch có còn là protocol đúng nữa không? Có phải chúng ta vẫn đang đóng gói sẵn ý định cho một cỗ máy không còn cần chúng ta làm vậy?

8. Máy không còn cần chúng ta đóng gói nữa

Vì lẽ ra nó không còn cần chúng ta nữa. Nó có thể hỏi một câu follow-up. Nó có thể làm rõ ngay giữa chừng một ý nghĩ. Nó có thể nhận ra mình đang thiếu gì đó và nói ra. Nó nên có tính conversational như con người.

Slide chữ: Because it shouldn't need us to anymore
Bốn dòng trên slide: nó không còn cần chúng ta nữa; nó có thể hỏi follow-up và làm rõ giữa chừng; nó có thể nhận ra mình thiếu gì và nói ra; nó nên conversational như con người.

Sherry Turkle của MIT nói điều này rất hay: trò chuyện là điều nhân văn nhất và làm con người trở nên người nhất mà chúng ta làm. Đó là một trong những siêu năng lực của nhân loại. Khả năng tương tác và suy nghĩ đang nằm ngay đó, vậy mà chúng ta vẫn bắt người dùng nộp xấp thẻ rồi chờ máy chạy.

Thực ra, ngay cả punch card cũng thừa hưởng protocol của nó. Batch đến từ khung cửi dệt vải, tức máy dệt Jacquard: bạn đặt toàn bộ hoa văn từ trước, rồi mới cho chạy tấm vải. Punch card được dùng lại trên máy tính theo mặc định. Và chúng ta lại đang đứng ở đúng khoảnh khắc ấy một lần nữa: AI cuối cùng đã có thể gặp chúng ta ngay giữa một ý nghĩ, nhưng lại được trao cho protocol của một khung cửi.

Đó là ý của Ted khi nói prompt vẫn là một punch card. Không phải vì cách bạn mã hoá nó, vì phần mã hoá thì mạnh và tuyệt vời. Mà vì LLM chỉ được phép tham gia sau khi bạn đã đóng gói trọn một lượt và submit. Và đây là chỗ sự lệch pha cắn vào.

Năng lực của model đang vọt thẳng lên. Reasoning, speech, vision, memory, planning, tất cả đều cong lên trên.

Biểu đồ Expressive growth với ba đường qua các thời kỳ từ punch card tới LLM
"Expressive growth": trục ngang đi qua Punch cards, Command line, GUI + mouse, Touch, LLMs. Đường đỏ (expressive ceiling, những gì bạn được phép nói) đi chậm rồi vọt thẳng lên ở LLMs. Đường xanh lá (channel, cách bit di chuyển về mặt vật lý) và đường xanh dương chấm (interaction protocol, ai giữ quyền nói) tăng dần qua các thời kỳ rồi gần như đi ngang từ Touch sang LLMs. Khoảng cách giữa đỉnh đỏ và đường channel được ghi là "the gap, the thesis".

9. Protocol đi ngang, và đó không phải lỗi của bạn

Còn protocol của giao diện thì đi ngang. Vẫn là một cái hộp, vẫn là một nút submit, vẫn là con người làm toàn bộ phần việc xung quanh LLM. Con người vẫn quyết định context nào quan trọng, vẫn phải nhớ cần hỏi gì, vẫn chọn thời điểm, vẫn phải tự nhận ra chỗ mơ hồ, vẫn phải sửa output, vẫn phải engineer prompt một cách cẩn thận.

Trí thông minh thì có cảm giác như phép màu. Chính giao diện mới là thứ vẫn có cảm giác như đi làm.

Một người ngồi trước màn hình máy tính, vẻ mặt đăm chiêu
Hình minh hoạ: một người ngồi gõ phím trước máy tính với vẻ mặt chăm chú. Đó là cảm giác khi giao diện bắt bạn làm hết phần việc xung quanh model.

Và khi nó có cảm giác như đi làm, khi output sai, khi những từ ngữ ma thuật không trúng, người ta tự trách mình. Họ kết luận rằng mình dở chuyện này. Rằng mình chưa đủ cụ thể. Rằng mình không hiểu AI.

Ted muốn nói rõ hết mức có thể: đó không phải lỗi của chúng ta. Chúng ta không dở trong việc dùng AI. Chúng ta đang bị yêu cầu vận hành một kiểu trí tuệ hoàn toàn mới thông qua protocol của một cái punch card. Sự lệch pha không nằm ở người dùng, nó nằm ở giao diện. Trong cuộc đua đưa AI vào sử dụng, chúng ta đã đi tắt ở phần giao diện.

10. "Hey, Ted, come on in"

Để làm cho mọi thứ cụ thể và quen thuộc, Ted kể một chuyện. Vài tuần trước, co-founder của anh dùng voice mode của một công ty frontier. Loại này được gọi là speech-to-speech model. Anh ấy hỏi một câu bình thường: "When is the next Timberwolves game?" (trận tiếp theo của Timberwolves là khi nào?). Ổn. Nó trả lời nhanh.

Sau đó anh ấy giả vờ như Ted vừa xuất hiện, như thể đang nói với Ted, và bảo: "Hey, Ted, come on in." Anh ấy không nói với AI, nhưng những model này không có cách nào để biết điều đó. Vậy là AI làm điều duy nhất một prompt box có thể làm: nó coi lời nói đó là một lượt và trả lời. "Sure, I'm here. What's on your mind?"

Giao diện chat Frontier Voice với câu hỏi về trận Timberwolves và câu Hey, Ted, come on in
Dựng lại cuộc trò chuyện trên một giao diện có nhãn "Frontier Voice": câu hỏi về trận Timberwolves được trả lời đúng ("The next Minnesota Timberwolves game is..."). Ngay sau đó, câu "Hey, Ted, come on in." nói với người khác lại bị coi là một lượt dành cho AI, và AI đáp "Sure, I'm here! What's on your mind?".

Đó không phải một câu trả lời tốt, nhưng đó cũng không phải một model ngốc. Nó đã trả lời câu hỏi đầu tiên một cách hoàn hảo. Vấn đề là đây là một protocol chỉ có đúng một ô: tin nhắn của bạn, rồi tới câu trả lời của nó. Nó không có khái niệm ai đang nói, hay những lời đó có phải dành cho nó hay không.

11. Ngành đang hội tụ: backchannel và turn-taking thật

Các công ty frontier cũng đang muốn tiến bước ở đây. Theo Ted, OpenAI phát hành GPT Realtime 2 vào cuối tháng Năm và bắt đầu thử nó cho voice mode của họ. Giờ nó biết backchannel: nó nói "Mm-hmm", "Right", những âm thanh nhỏ chúng ta phát ra để cho thấy mình đang chủ động lắng nghe. Ted thấy cả lĩnh vực đang hội tụ về cùng một kết luận mà JoinIn AI đã đặt nền móng công ty lên đó: giao diện phải thôi là batch và bắt đầu tham gia vào cuộc trò chuyện.

Những nơi khác cũng đang làm real-time conversation. Ted cho xem PersonaPlex của NVIDIA, một research model, không phải của JoinIn, và bảo người xem để ý chuyện gì xảy ra khi nó bị ngắt lời.

Trang nghiên cứu PersonaPlex của NVIDIA ADLR với các ví dụ âm thanh
Trang PersonaPlex của NVIDIA ADLR: việc bổ sung các yếu tố phi ngôn ngữ giúp model tái tạo những tín hiệu con người dùng để đọc ý định, cảm xúc và mức độ hiểu. Ví dụ đầu tiên, "Assistant", lấy từ phần đánh giá interruption của FullDuplexBench, thể hiện khả năng bị ngắt lời và turn-taking tự nhiên.

Trong đoạn demo, người dùng nói: "Tôi đang nghĩ tới chuyện bắt đầu ăn kiêng." PersonaPlex đáp rằng bắt đầu ăn kiêng có thể hơi đáng ngại, nhưng có thể giữ nó đơn giản: tập trung ăn nhiều rau và trái cây hơn, thử... Người dùng chen ngang: "Ồ, trước khi tôi quên, tôi vừa đăng ký chạy marathon." Nó đáp: "All right. Chúc mừng bạn đã đăng ký marathon. Đó là một thử thách lớn. Bạn còn nhiều thời gian. Hãy tập trung xây một nền tảng vững với những buổi chạy dài đều đặn. Uống đủ nước. Nạp năng lượng đúng cách trước và sau khi chạy, và đừng quên giãn cơ và chăm sóc đôi chân."

PersonaPlex dừng lại. Nó nhường lượt. Nó nhặt lại sợi chỉ của câu chuyện. Đó là turn-taking thật: vừa nghe vừa nói cùng lúc, theo thời gian thực.

Ví dụ thứ hai là một cuộc trò chuyện đan xen. Một người nói: "Bạn phải tới thăm tôi..." Model: "Ồ, okay." "...vì khi đó mình có thể vào thành phố." "Okay." "Vì chuyện là, kiểu như..." "Yeah." "...có mấy bức vẽ sơn xịt ngẫu nhiên, nhưng cũng có cả, kiểu..." "Tôi không chắc lắm, chắc người ta phải đặt vẽ chúng..." "Yeah, tôi nghĩ là có." "...kiểu những bức mural sơn xịt khổng lồ ấy." "Yeah." PersonaPlex backchannel, lắng nghe, và chen vào đúng chỗ mà một con người sẽ chen vào.

Ngoài nhịp chảy của cuộc trò chuyện, còn rất nhiều thách thức khác, và đây là một bài toán phức tạp. Phát ra âm thanh lắng nghe không giống với việc biết ai đang ở trong phòng. Những model này không được huấn luyện để nhận ra câu "Hey, Ted" không dành cho nó. Nhưng JoinIn thì có. Nhóm của Ted đang cải thiện protocol tới các model bằng cách cho chúng hiểu tốt hơn về hội thoại của con người và hội thoại nhóm.

Sơ đồ Conversation is more than turn-taking, ô FLOW được làm nổi bật
Slide "Conversation is more than turn-taking", với ô "2. Flow" được làm nổi bật: turn-taking, backchannel ("mm-hmm"), interruptions và repair, timing, overlap. Các phần khác của sơ đồ bị làm mờ, đúng ý Ted rằng flow chỉ là một trong nhiều mảnh của hội thoại thật.

12. Demo: một AI ngồi trong cuộc họp

Rồi Ted cho xem demo của JoinIn: một buổi "Product requirements review" với ba người, Dana (stakeholder), Sam (product lead) và Jordan (engineering), cùng một AI tham gia.

Mọi người chào nhau: "Good afternoon, everyone." "Good afternoon, Sam." "Hi, Jordan." "Good to see you both." Có người hỏi nhanh: "Requirement này là cái nào? Mình có ID không?" AI trả lời: đây là REQ-142, expense approvals. Đó, nó vừa trả lời một câu hỏi.

Ted giải thích cách hệ thống quyết định khi nào lên tiếng. Nó chỉ hành động dựa trên một utility-driven model: nó tạo ra các goal cần hoàn thành, trong lúc gắn nhãn cho từng câu của người tham gia là question, proposal hay answer, và chỉ nhận một lượt nói khi không ai khác đang nói hay đang giữ quyền nói.

Cuộc họp tiếp tục. Dana: "Right. Chúng ta cần người dùng duyệt request nhanh hơn." Sam: "Yeah, luồng approval chậm quá." Jordan: "Nhưng là loại request nào?" Dana: "Expense approvals trước, access requests thì sau." Sam: "AI, hold that." Rồi: "Thật ra, dừng một chút. Expense approvals, hay một approval workflow tổng quát?" Dana: "Expense approvals, bản phát hành đầu tiên." Sam: "Access requests là future scope." Jordan: "Vậy thì data model thay đổi. Tốt khi biết." Sam: "AI, pull that up for everyone."

Giao diện JoinIn trong buổi Product requirements review, mỗi câu được gắn nhãn, panel bên phải ghi Recalling context
Bên trái, từng câu được gắn nhãn: answer, proposal, agree, question, directive, acknowledge. Bên phải, AI đang "Recalling context" từ kiến thức riêng của dự án: một ghi chú chỉ người lead thấy, rằng project charter (Finance Controls Policy v3) đã yêu cầu duyệt cấp hai cho expense trên $5,000 mà chưa ai nhắc tới. Kèm một "Suggested clarification" (expense approvals hay approval workflow tổng quát?) với hai nút Hold và Bring into room. Dòng chú thích dưới cùng: "It also remembers what the room forgot."

Ted chỉ ra rằng tracking, tức là xác định người nói đang nhắm tới ai, là cực kỳ quan trọng. Ở trường hợp này thì dễ vì có lời gọi thẳng tới AI, nhưng chuyện đó sẽ lại xảy ra mà không có lời gọi trực tiếp nào.

AI đưa quy định ra cho cả phòng. Jordan: "Ồ, tôi quên mất đó là một quy định." Dana: "Vậy trên 5,000 thì cần người duyệt thứ hai?" Sam: "Đúng, manager cộng với finance." Jordan: "Vậy khoản lớn thì không thể duyệt bằng một cú chạm." Sam: "Right. Vượt ngưỡng thì nó được chuyển tới người duyệt thứ hai." Dana: "Đồng ý. Dưới năm nghìn thì một cú chạm là được." Jordan: "Tôi thấy ổn." Sam: "Okay. Chốt. Expense approvals, ngưỡng 5,000."

Ngay tại đó, AI đã giải quyết xong mục tiêu về scope. Không ai viết prompt. Không ai đóng gói một lượt rồi bấm Submit. Hệ thống ở trong cuộc trò chuyện, theo dõi nó, hiểu nó, và chọn thời điểm của mình.

Sam: "AI, capture that for us." AI tóm lại: bản phát hành đầu tiên chỉ hỗ trợ expense approvals. Access requests nằm ngoài scope. Manager có thể duyệt hoặc từ chối một expense ngay từ notification. Và theo finance controls policy, mọi khoản trên $5,000 được chuyển tới người duyệt thứ hai.

Giao diện JoinIn sau khi chốt, panel bên phải liệt kê goal, requirement, acceptance criteria, out of scope, open question
Kết quả sau khi phòng chốt: danh sách goal được đánh dấu (đã xác định REQ-142, đã giải quyết approval scope, expense approvals cho bản đầu, áp ngưỡng $5,000), một requirement, các acceptance criteria (manager nhận notification, duyệt hoặc từ chối từ notification, khoản trên $5,000 lên duyệt cấp hai gồm manager và Finance, nhân viên được báo kết quả, quyết định được ghi vào audit history), phần out of scope, một open question (ngưỡng $5,000 trong Finance Controls Policy v3, §4.2 có còn hiện hành không) và owner: Product xác nhận ngưỡng với Finance trước thứ Sáu. Dòng chú thích: "A decision, not a transcript."

Một người sửa lại: "Thật ra, đặt ngưỡng là 10,000, không phải 5,000." AI hỏi lại: "Bạn muốn tôi cập nhật requirement thành ngưỡng 10,000 chứ?" "Yes." Rồi một câu hỏi khác hẳn: "AI, phòng này có trống sau buổi họp không?" "Để tôi kiểm tra. Phòng có vẻ trống sau buổi này, nhưng..." "Tới 3 giờ?" "Đúng. Phòng là của bạn tới 3 giờ."

Và theo Ted, đó là khác biệt giữa một cỗ máy thông minh nằm sau cùng cái prompt cũ, với một giao diện cuối cùng đã thật sự tham gia.

13. AI là một interface technology

Đây là thay đổi tư duy Ted muốn để lại: AI không chỉ là một công nghệ trí tuệ. Nó ngày càng trở thành một công nghệ giao diện, một interface technology. Và nếu vậy, thì những model "giỏi sách vở" thôi là chưa đủ.

Hãy thôi hình dung AI như một cỗ máy thông minh hơn nấp sau prompt, agent, loop và tất cả các paradigm cũ. Chúng ta phải bắt đầu thấy chính trí thông minh là thứ cuối cùng có thể gỡ bỏ những ràng buộc giao diện và khuếch đại tiềm năng con người.

Suốt 75 năm, con người đã thích nghi với máy: cú pháp của nó, form của nó, timing của nó, batch của nó. Một hệ thống có thể reason, lắng nghe, suy luận, thích nghi thì lẽ ra phải có thể gặp chúng ta ở nửa đường, nếu không phải là cả quãng đường. Nếu AI là để phục vụ người dùng, thì chúng ta nên ám ảnh với việc tối đa hoá giao diện.

Khi đó, câu hỏi thiết kế thay đổi. Nó cần trở thành:

What burden are we still putting on humans only because the machine used to be too limited to carry that burden itself?

Tức là: gánh nặng nào chúng ta vẫn đang đặt lên con người, chỉ vì trước đây máy móc quá hạn chế để tự gánh lấy nó? Hỏi câu đó, và cả không gian giao diện mở ra.

communication một câu hỏi một khoảng dừng một bản phác thảo một checklist một lời nói khẽ không nói gì cả
Câu trả lời đúng là những affordance con người vốn đã dùng với nhau. Chọn đúng channel vào đúng lúc là việc của AI, không phải của người dùng.

Câu trả lời không phải lúc nào cũng là chat. Không phải lúc nào cũng là voice, và không phải một bức tường markdown. Chắc chắn không phải một bộ cấu trúc kỹ thuật số đã cũ cả thập kỷ. Câu trả lời đúng là affordance mà con người vốn đã dùng với nhau: giao tiếp, một câu hỏi, một khoảng dừng, một bản phác thảo, một checklist, một lời nói khẽ bên lề, hoặc không nói gì cả. Một giao diện mà ở đó timing và modality không còn là việc của con người, nơi việc chọn đúng channel vào đúng thời điểm do AI làm.

Là một người làm usability, Ted nói đây là phần khiến anh hào hứng nhất.

14. Bỏ xuống những loại thuế cũ

Khi bạn gỡ gánh nặng đó khỏi người dùng, ma sát biến mất và adoption sẽ theo sau.

Cho tới nay, điện toán phần lớn là về việc cải thiện cách con người mã hoá ý định của mình cho máy. Punch card, gõ một command, click một menu, dùng ngón cái trên iPhone, viết một prompt. Mỗi bước đều là tiến bộ, và mỗi bước đều mang ràng buộc cũ đi tiếp vào thời đại kế tiếp: một thứ thuế dịch thuật, thuế chính xác, thuế context, thuế sửa chữa.

punch card command menu ngón cái, iPhone prompt mỗi bước mang theo ràng buộc cũ translation tax · precision tax · context tax · repair tax
Mỗi bước là tiến bộ, nhưng bốn loại thuế vẫn bị mang theo từ thời đại này sang thời đại kế tiếp.

AI là cơ hội để chúng ta đặt những thứ thuế đó xuống. Không phải bằng cách làm mọi thứ thành phép màu, không phải bằng cách biến mọi thứ thành voice, không phải bằng cách thay thế phán đoán của con người, mà bằng cách khiến máy tính, lần đầu tiên, trở nên lưu loát hơn với chúng ta.

Phần lớn các talk và video nói về cách dùng hay áp dụng AI. Câu hỏi sâu hơn là trí thông minh của AI thay đổi giao diện như thế nào. Hội thoại là điều nhân văn nhất chúng ta làm. Bởi vì nếu cuối cùng một cỗ máy có thể hiểu được nhiều hơn những gì chúng ta muốn nói, thì chúng ta có thể, và nên, thôi uốn nắn bản thân để được nó hiểu.

Ted cảm ơn và kết thúc talk.

Nguồn và liên kết