Это пробный урок. Оформите подписку, чтобы получить доступ ко всем материалам курса. Премиум

  1. Урок 1. 00:06:11
    001 Video Welcome! Introduction and Logistics
  2. Урок 2. 00:04:45
    002 What is AI Evals
  3. Урок 3. 00:04:05
    003 Pitfalls of LLM Leaderboards & Benchmarks
  4. Урок 4. 00:05:09
    004 AI Product vs. AI Model
  5. Урок 5. 00:03:33
    005 Regulation and Compliance
  6. Урок 6. 00:08:18
    006 Just Use an Evals Vendor Solution
  7. Урок 7. 00:26:30
    007 Topic AI Evals Vendor Tools
  8. Урок 8. 00:04:06
    008 Framework & The Playbook
  9. Урок 9. 00:08:20
    009 Scope of AI Evals Project
  10. Урок 10. 00:07:10
    010 Roles on AI Evals Team
  11. Урок 11. 00:03:52
    011 Human Evals
  12. Урок 12. 00:07:40
    012 Automated Evals
  13. Урок 13. 00:05:55
    013 Human vs. Automated Evals
  14. Урок 14. 00:02:35
    014 What & Why
  15. Урок 15. 00:05:38
    015 Taxonomy Generation & Trace Bootstrapping
  16. Урок 16. 00:05:01
    016 Case Study - Tutor Bot
  17. Урок 17. 00:01:11
    017 Quick Recap
  18. Урок 18. 00:04:16
    018 What is Quantitative Evals
  19. Урок 19. 00:06:29
    019 Quantitative Evaluation Metrics
  20. Урок 20. 00:04:05
    020 Case Study - Tutor Bot (1)
  21. Урок 21. 00:05:16
    021 LLM-as-a-judge
  22. Урок 22. 00:05:51
    022 What is Evaluator and How to Write Rubrics
  23. Урок 23. 00:02:57
    023 How Do Evals Drive Decisions
  24. Урок 24. 00:03:19
    024 Test Set Overview
  25. Урок 25. 00:07:06
    025 Test Set Gen I - Building Scenarios
  26. Урок 26. 00:01:56
    026 Test Set Gen II - Historical Data
  27. Урок 27. 00:03:30
    027 Test Set Gen III - Synthetic Data
  28. Урок 28. 00:05:09
    028 How to Determine Test Set Size
  29. Урок 29. 00:04:56
    029 Topic AI Governance
  30. Урок 30. 00:14:24
    030 Topic Linguistic Metrics
  31. Урок 31. 00:06:36
    031 Topic Multi-turn & Multimodal
  32. Урок 32. 00:35:30
    032 Quantitative Evals In Action
  33. Урок 33. 00:03:25
    033 Experiment Pilot
  34. Урок 34. 00:02:28
    034 What Could Go Wrong in Production
  35. Урок 35. 00:03:57
    035 Evals vs. Analytics
  36. Урок 36. 00:03:59
    036 What to Monitor in Production
  37. Урок 37. 00:04:33
    037 Case Study -Tutor Bot
  38. Урок 38. 00:02:30
    038 Wrap Up
  39. Урок 39. 00:03:41
    039 From Evals to Business Impact
  40. Урок 40. 00:03:55
    040 Topic Data Pre-processing
  41. Урок 41. 00:07:22
    041 Topic Open Source Frameworks
  42. Урок 42. 00:32:09
    042 Topic Evaluate AI Agents with Simulated Users