QAПідрозділ
Тестування AI
Коли той самий ввід перестає давати той самий вивід, перевірка на рівність втрачає сенс, а один запуск перестає бути доказом. Три теми: що це змінює для того, хто пише кейси; як оцінити одну відповідь, не витрачаючи гроші на заміну факту думкою; і як відрізнити справжню регресію від шуму семплінгу. Експлуатація LLM-фічі в продакшні — це LLMOps у «Розробці»; ці три володіють її тестуванням.
Що всередині
Усі сторінки цієї групи — і про що кожна з них.
- Тестування LLM-продуктівСпершу детермінований шар — схема, інструменти, цитати, безпека, бюджет, — далі хто чим володіє і де що запускається.Спершу точнеПайплайн
- Оцінювання AIДрабина оцінювачів від точного збігу до людини, калібрування судді й як читати частку, не обманюючи себе.Набори оцінокСудді
- Регресія промптівПокейсна базова лінія, чотири речі, які треба закріпити, межа шуму й захищений набір, що блокує реліз.БазаЗакріплення
З чого почати
- Тестуєте фічу на LLMТестування LLM-продуктів. Більшість важливого досі перевіряється точно — саме на цей шар і варто витратити перший тиждень.
- Будуєте набір оцінокОцінювання AI — спершу драбина оцінювачів: більшість наборів оцінюють значно вище, ніж потрібно.
- Змінюєте промптРегресія промптів. Порівнюйте покейсно проти записаної бази: середнє ховає саме зламані кейси.
Інше в цьому розділі
- QAЗабезпечення якості (QA) — це практика вирішувати, що перевіряти, запускати ці перевірки достатньо часто, щоб вони мали сенс, і розуміти, що змінюється, коли те, що тестують, перестає давати ту саму відповідь двічі. У розділі 9 тем у трьох групах: види тестування, які всі памʼятають наполовину; автоматизація на Playwright, Cypress і Selenium; і тестування продуктів на мовних моделях, де твердження стає оцінкою, а не рівністю.
- AI та LLMЯк будувати фічі на компоненті, що двічі дає різні відповіді на те саме питання. Шість тем у порядку появи: що модель насправді робить, як її правильно питати, як дати їй ваші дані, коли міняти саму модель, як усе це запускати в продакшні й що змінюється, коли вона може викликати інструменти. Тестування таких фіч — окрема дисципліна, і воно живе в розділі QA.
- Види тестуванняТри види тестів, які кладуть в один список і які не є порівнюваними. Smoke — це ворота: він вирішує, чи вартий білд чийогось часу. Регресія — це памʼять: вона памʼятає, що вже одного разу зламалося. Наскрізний — це рівень: єдине місце, де можна довести, що зібрана система працює. Перші два є причинами запускати тести й можуть бути написані на будь-якому рівні, — і саме цю відмінність пропускає більшість відповідей на співбесідах.
Було корисно?
Поділіться з тим, хто працює над тією ж задачею.