Ang Apache Spark ay isang malakas na open-source frame na dinisenyo para sa malaking-scale data processing at analysis. Ang pag-set up Spark ay mahalaga para sa mga inhinyero na gumagawa ng malalaking datasets upang matiyak ang kahusayan at pagiging ma-claim. Ang gabay na ito ay nagbibigay ng isang hakbang-by-path compilation ng kung paano i-set ang Apache Spark para sa inhenyeriyang pagsusuri ng data.
Mga Prerequisite at mga Kahilingan sa Sistema
Bago magkabit ng Spark, tiyaking nasasapatan ng iyong sistema ang kinakailangang mga kahilingan:
- Isang operating system ng Linux o Windows
- Java Development Kit (JDK) 8 o mas mataas na nakaluklok
- Hindi bababa sa 8 GB ng RAM para sa pinakamahusay na pagganap
- Python 3.x kung gumagamit ng PySpark
Paglalagay ng Java at Pagsiklab
Magsimula sa pag-install ng JDK, na depende sa Spark. download ang pinakabagong bersyon mula sa opisyal na website ng Oracle o gamitin ang manager ng pakete ng inyong sistema. Pagkatapos i-install ang Java, tiyakin ang pag-install sa pamamagitan ng pagtakbo:
Pagkatapos, i - download ang Apache Spark mula sa opisyal na website. Piliin ang pre-build na pakete para sa iyong operating system. I - download ang naka-download na arkibo sa isang mas gustong directory.
Ang kapaligirang konfigure ay nag-iiba-iba tulad ng at idinagdag ang Spark's directory sa ⁇ H ng inyong sistema upang madaling ma-access mula sa command line.
Pag - aayos sa Hagdan ng Malalaking Data
Ang pagbabago sa mga pagsasaayos ng Spark upang gawing napakahusay ang pagganap para sa malalaking datasets.
- Examintor Memory: Isulat ang sapat na memorya para sa mga manggagawa node, e.g.,
- Number of Executors: Nakalagay batay sa iyong kumpol, e.g.,
- D ventriver Memory: Ang Allocate memory para sa programang driver, e.g.,]
Pag - init ng Damdamin sa Isang Magulong Kapaligiran
Para sa malaki-scale analysis, ang paglalagay ng Spark sa isang kumpol ay inirerekomenda. Ang mga kilalang cluster manager kabilang ang Apache Hadoop YARN, Apache Mesos, o ang standone cluster mode ni Spark. Configure the cluster manager sa pamamagitan ng pag-aayos ng file at pag-dededyt sa master URL.
Paandarin ang midya Ang Spark master at worker nodes, pagkatapos ay isumite ang inyong spark applications gamit ang:
Paggamit ng PySpark para sa Inggit na Python
Ang PySpark ay nagpapahintulot sa mga gumagamit ng Python na mag - imprenta ng mga kakayahan ni Spark. Iluklok ang PySpark sa pamamagitan ng pip:
Unang - una'y gumawa ng isang sesyon ng spark sa inyong mga sulat Python:
Pagsasaayos
Ang paglalagay ng Apache Spark para sa malaking-scale engineering data analysis ay kinasasangkutan ng pag-install ng kinakailangang software, kompleks na kompuwesto at Spark parameter, at paglalagay sa isang partikulong kapaligiran.Ang wastong setup ay tumitiyak ng mahusay na pagpoproseso ng malalaking datasets, na nagpapangyari sa mga inhinyero na makakuha ng mahalagang mga kabatiran mula sa kanilang mga datos.