การเปิดใช้งานฟังก์ชันเป็นส่วนประกอบที่สําคัญในเครือข่ายประสาท การแนะนําการไม่เชิงเส้นที่ทําให้แบบจําลองสามารถเรียนรู้รูปแบบที่ซับซ้อนได้ การเลือกฟังก์ชันแบบฉลาด ๆ ที่เหมาะสม สามารถมีผลกระทบอย่างมากต่อการทํางานและการอบรมอย่างมีประสิทธิภาพของแบบจําลอง บทความนี้จะให้ภาพรวมของฟังก์ชันทั่วไปที่ช่วยในการตัดสินใจเลือกข้อมูล

การปฏิบัติการทั่วไป

การ เข้าใจ ลักษณะ เฉพาะ ตัว ของ มัน ช่วย ใน การ เลือก งาน ที่ ดี ที่ สุด สําหรับ งาน เฉพาะ อย่าง.

ตัววัดความจุ

การคํานวณค่าตัววัดของฟังก์ชันการอนุมานรวมถึง:

  • [FLT: 0] การไหลของแสง: กําหนดว่าฟังก์ชันจะกระจายเกรเดียนได้ดีแค่ไหนระหว่างการไหลด้านหลัง
  • [FLT: 0] ช่วงนอกระบบ: มีอิทธิพลต่อความสามารถของผู้เผยแพร่ข้อมูลในโมเดลการกระจายข้อมูลที่แตกต่างกัน
  • [FLT: 0] มีประสิทธิภาพในการประกอบกิจการ : ผลกระทบต่อความเร็วการฝึกและการใช้ทรัพยากร (FLT:1).

การเปรียบเทียบแบบมีคุณภาพ

ด้านล่างนี้เป็นการเปรียบเทียบของฟังก์ชันที่นิยมใช้ร่วมกัน โดยอิงจากคุณสมบัติของพวกเขา

  • [FLT: 0]. ReLU: ส่งออกเป็นศูนย์สําหรับค่า input และเชิงเส้นสําหรับค่าบวก มันมีเกรเดียน 1 ค่าเป็นบวก ทําให้มีประสิทธิภาพในการฝึกเครือข่ายลึก
  • [FLT: 0] Sigmiid: ผลิตผลระหว่าง 0 ถึง 1. เกรเดียนส์จะลดลงสําหรับขนาดป้อนข้อมูลขนาดใหญ่ ซึ่งสามารถเรียนรู้ได้ช้า
  • [FLT: 0] Tanh: ส่งออกระหว่าง -1 ถึง 1. คล้ายกับซิกมอยด์ แต่ศูนย์กลางเป็นศูนย์ ปรับปรุงการบรรจบกันในบางกรณี
  • [FLT: 0] เลอาชี เรลู: อนุญาตให้เกรเดียนขนาดเล็กสําหรับค่า inputs ลบ ลดปัญหา "Dieing ReLU"

เลือก ปฏิบัติ การ เพื่อ การ รับ ใช้ ที่ ถูก ต้อง

การเลือกขึ้นกับโปรแกรมและสถาปัตยกรรมแบบเฉพาะ การวิเคราะห์แบบควอนตัม แสดงให้เห็นว่า ReLU และตัวแปรต่าง ๆ นี้ จะช่วยให้การฝึกซ้อมง่ายขึ้น และมีประสิทธิภาพมากขึ้น ในเครือข่ายที่ไหลมากขึ้น ซิกโมนด์และแทนห์ อาจเหมาะกับการส่งออกชั้นหรืองานเฉพาะที่ต้องใช้ขอบเขต