Консультація є широко використовуваним машинним навчальним підходом, що включає в себе моделі навчання на позначених даних. Однак, практикуючими часто зустрічаються загальні підводні камені, які можуть вплинути на продуктивність і надійність їх моделей. Розуміння цих питань і застосування відповідних обчислень може допомогти пом'якшити їх вплив.

Наряд і підживлення

Настроювання відбувається, коли модель вивчає дані про навчання, зокрема шум, що веде до бідної узагальнення на нових даних. Підходить для того, як модель занадто проста у використанні базових шаблонів. Розрахунок таких як рівень підготовки та перевірки помилок може допомогти визначити ці проблеми.

Наприклад, порівняння помилки навчання (E]тренування) та помилки валідації (Eval) може вказувати на перенаряддя, якщо Etrain] дуже низький, коли Eval є високою. Попередження, високі помилки як пропонують підрядування.

Класна імбаланс

Наведено класи, коли деякі класи присутні в датасеті, що веде до з'єднання моделей. Розрахунок відсотків розподілу класу дозволяє виявити небаланс.

Надаючи дані, що мають 1000 зразків, з 900, що належать до класу А та 100 класу Б. Відсотки розподілу класу є:

Клас А: (900/1000) * 100 = 90%

Клас B: (100/1000) * 100 = 10%

Оцінювання продуктивності моделі

Метричні речовини, такі як точність, точність, згадування та F1-score, необхідні для оцінки продуктивності моделі. Розрахунок включають компоненти матриці конфузії:

  • Справжні Позитивні результати (ТП)
  • Фальшиві Позитивні результати (FP)
  • Негативи Фальзи (FN)

Наприклад, точність розраховується як:

Точність = TP / (TP + FP)

Обробка даних шуму

Невідомі дані можуть спотворювати модельне навчання. Розрахунок таких як шумосигнальне співвідношення допомагають кількісно визначити якість даних.

Надаючи дані, що містять 100 зразків шуму з 1000 всього зразка. Співвідношення шуму:

Нойсе Ratio = (Кількість зразків імен) / (Всього { key3}) = 100 / 1000 = 0,1 або 10%