Topics / Evals
Evals
9 talks
Skill-creator mới: test, đo và tối ưu Claude skill
Ray Amjad · Ray Amjad · 13 min
Skill-creator mới của Anthropic: hai loại skill, chạy evals và A/B test mù có/không skill, benchmark, tối ưu description để skill trigger ổn định.
Tạo skill đầu tiên trong Claude
Tom Nassr · Tom Nassr | XRAY · 9 min
Tạo skill YouTube chapters bằng skill-creator trên claude.ai, dùng nó trong chat mới, rồi để Cowork chạy test và benchmark để tinh chỉnh skill.
Nhân viên Anthropic thật sự dùng Claude skills thế nào
Austin Marchese · Austin Marchese · 16 min
Năm bài học từ playbook nội bộ của Anthropic: bốn skill type, scripts và templates, verifier, gotchas và cách viết description để skill tự trigger.
Eval trong production cho hệ thống agentic AI
Nishant Gupta · Meta · 8 min
Eval cho agent phải đo hành vi cả hệ thống: scenario offline, production telemetry, human review, drift, trace và metric reliability gắn với kết quả kinh doanh.
Giả thuyết Miranda: vở musical Hamilton đã đầu độc persona eval của bạn ra sao
Jacob E. Thomas · Results Generation · 58 min
Vì sao persona eval chấm fluency không bắt được persona ghép lẫn văn hoá sai thời đại, và instrument pre-registered với nhà sử học để đo fidelity.
Đối chiếu nhiều tài liệu bằng AI để kiểm tra tuân thủ tài chính và phát hiện gian lận
Varsha Shah · Tata Consultancy Services · 19 min
Gian lận nằm giữa các tài liệu: nối payroll, thuế, mua hàng bằng graph, chấm risk score theo xác suất, chuẩn hoá giữa các jurisdiction.
Tín hiệu từ user chết ở ranh giới retrieval
Sonam Pankaj · StarlightSearch · 16 min
Vì sao tín hiệu eval chết trong dashboard, và cách dùng utility score để re-rank memory theo outcome, giúp agent tự cải tiến lúc runtime.
Continual learning cho AI agent: từ thất bại tới cải tiến bền vững
Soheil Feizi · RELAI · 22 min
Biến log và feedback production thành learning environment replay được, sửa agent ở đúng layer (model, harness, memory) mà không gây regression.
Vì sao agent bất đồng với chính nó, và nên làm gì
Diane Lin · Datadog · 26 min
Agent flip-flop là dấu hiệu của gray zone: dùng disagreement để chọn ca cho người review, rồi thêm semantic và episodic memory thay vì fine-tune.