Topics / Evals

Evals

9 talks

Skill-creator mới: test, đo và tối ưu Claude skill

Ray Amjad · Ray Amjad · 13 min

Skill-creator mới của Anthropic: hai loại skill, chạy evals và A/B test mù có/không skill, benchmark, tối ưu description để skill trigger ổn định.

Tạo skill đầu tiên trong Claude

Tom Nassr · Tom Nassr | XRAY · 9 min

Tạo skill YouTube chapters bằng skill-creator trên claude.ai, dùng nó trong chat mới, rồi để Cowork chạy test và benchmark để tinh chỉnh skill.

Nhân viên Anthropic thật sự dùng Claude skills thế nào

Austin Marchese · Austin Marchese · 16 min

Năm bài học từ playbook nội bộ của Anthropic: bốn skill type, scripts và templates, verifier, gotchas và cách viết description để skill tự trigger.

Eval trong production cho hệ thống agentic AI

Nishant Gupta · Meta · 8 min

Eval cho agent phải đo hành vi cả hệ thống: scenario offline, production telemetry, human review, drift, trace và metric reliability gắn với kết quả kinh doanh.

Giả thuyết Miranda: vở musical Hamilton đã đầu độc persona eval của bạn ra sao

Jacob E. Thomas · Results Generation · 58 min

Vì sao persona eval chấm fluency không bắt được persona ghép lẫn văn hoá sai thời đại, và instrument pre-registered với nhà sử học để đo fidelity.

Đối chiếu nhiều tài liệu bằng AI để kiểm tra tuân thủ tài chính và phát hiện gian lận

Varsha Shah · Tata Consultancy Services · 19 min

Gian lận nằm giữa các tài liệu: nối payroll, thuế, mua hàng bằng graph, chấm risk score theo xác suất, chuẩn hoá giữa các jurisdiction.

Tín hiệu từ user chết ở ranh giới retrieval

Sonam Pankaj · StarlightSearch · 16 min

Vì sao tín hiệu eval chết trong dashboard, và cách dùng utility score để re-rank memory theo outcome, giúp agent tự cải tiến lúc runtime.

Continual learning cho AI agent: từ thất bại tới cải tiến bền vững

Soheil Feizi · RELAI · 22 min

Biến log và feedback production thành learning environment replay được, sửa agent ở đúng layer (model, harness, memory) mà không gây regression.

Vì sao agent bất đồng với chính nó, và nên làm gì

Diane Lin · Datadog · 26 min

Agent flip-flop là dấu hiệu của gray zone: dùng disagreement để chọn ca cho người review, rồi thêm semantic và episodic memory thay vì fine-tune.