Çevre Mühendisliğinde Gelişmiş Veri İşlemeye Sahip Büyü

Çevre mühendisliği, doğrudan halk sağlığı ve ekosistem sürdürülebilirliğini etkileyen bir disiplindir. Bölgede kimyasal işletmeyi nehirlerde analiz etmek için şehir içi meseleden, meslek bu hacimde hıza sahip olmak için ağır bir şekilde dayanır. Modern çevre izleme ağları, petabaylar, istasyonlu sensörler, mobil monitörler ve IoT cihazları ile günlük verilerinin petabaylar tarafından kaybedilir.

Apache Spark dönüştürücü bir çözüm olarak ortaya çıktı. Başlangıçta UC Berkeley'in AMPLab'de gelişmişti, Spark şimdi dağıtılmış, açık kaynaklı bir çerçeve, ürün donanım kümeleri arasında belge işleme imkanı sağlayan olgun ve açık kaynak çerçevesi sunuyor.

Apache Spark Nedir?

Apache Spark, geniş ölçekli veri işleme için birleşik, açık kaynak analiz motorudur. Tüm kümeleri kapalı veri paralelliği ve hata toleransı ile programlamak için bir arayüz sağlar. disk tabanlı MapReduce paradigmasının aksine, Spark makine öğrenimi ve interaktif analiz için idealdir.

Core Bileşenler

  • [FONT:0]Spark Core:[Döneticileri görev zamanlama, hafıza yönetimi, hata kurtarma ve depolama sistemleri ile etkileşim (HDFS, S3, yerel dosyalar).
  • [FONT:0]Spark SQL:[DÜDÜDÜDÜDÜDÜDÜDÜSTRİYE:0)[[DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSTRİYE) .
  • [FONT:0]Spark Streaming:[Dönetici:[Dönetici: 0) Kafka, Kinesis veya TCP soketleri mikro-batch veya sürekli işlem kullanarak gerçek zamanlı veri akışları.
  • [FONT:0)MLlib:[Dönetici:[Dönetici: · 1 ) Sınıflandırma, regresyon, kümeleme, işbirlikçi filtreleme ve özel mühendislik için algoritmaları ile ölçeklenebilir bir makine öğrenme kütüphanesi.
  • [FONT=0)GraphX:[Dönetici:[Dönetici: 0) Ağ analizi için grafik-parallel hesaplama, kirletici taşıma veya tür göç yolları için kullanışlı.

Spark, Apache Hadoop YARN'de veya Amazon EMR, Azure HDInsight ve Google Dataproc gibi bulut ortamlarında konuşuluyor olabilir. Python (PySpark), R (SparkR), Scala ve Java, NumPy ve pandas gibi çevresel mühendisler için giriş engelini azaltır.

Neden Spark Çevre Mühendisliği için Temeldir

Çevre veri setleri doğal olarak zorlanır: büyük, dağıtılır, gürültülü ve sık sık zaman duyarlıdır. Spark bu zorlukların doğrudan ele alındığı.

Hız ve In-Memory Processing

Geleneksel Hadoop MapReduce her haritadan sonra ara sonuçlar yazar ve adım azaltır. Spark hafızada veri tutar, her birkaç saniye güncelleyen 10-100x hız iyileştirmelerine izin verir (örneğin, k-means for poll pattern detect) ve regresyon (örneğin, PM2.5 tahmin).

Büyülü Sensör Ağları için Scalability for Grow Sensör Networks

Şehirler daha fazla hava kalitesi sensörleri ve su izleme otobüsü dağıtıyor gibi, veri hacmi lineer olarak. Spark kümeleri paralel olarak düğümleri tekrar-argılama boru hatları olmadan genişletebilir. Örneğin, [[ŞUFOA'nın Hava Kalite Sistemi binlerce monitörden gelen verilerde; bir Spark akış boru hattı, paralel olarak, geçerlilik ve paralel olarak ele geçirilebilir.

Uyarılar için Gerçek Zaman İşleme

Çevre tehlikeleri hemen yanıt gerektirir. Spark Streaming süreçleri mikro-bataklarda kayıtlar (örneğin, her 1-10 saniyede), toksik eşlerin aşıldığı zaman uyarıları tetikler yapabilmelerine izin verir.

Birleşik Batch ve Stream Processing

Birçok çevresel iş akışları tarihsel analizleri birleştirir (örneğin, trend raporlama) gerçek zamanlı izleme ile. Spark'ın birleşik motoru, mühendislere hem toplu hem de akış işlerini için aynı kodu kullanmalarını sağlar, bakım yükünü azaltır ve geçmiş ve şimdiki görüşler arasındaki tutarlılığı sağlar.

MLlib ile Gelişmiş Analytics

Makine öğrenimi, biromali tespit için çevresel mühendislikte giderek daha fazla kullanılıyor, kaynak uygulamacılığı ve tahmin edici modelleme. MLlib, kirliliği kaynakları ve K-meansları sınıflandırmak için rastgele ormanlar gibi yaygın algoritmaların ölçeklenebilir uygulamaları sağlar. Bu doğrudan Spark DataFrames'de hareketsiz bir şekilde çalıştırılabilir bir MLlib platformuna doğru hareket edebilir.

Anahtar Kullanım Vakaları Çevre Mühendisliğinde

Hava Kalite İzleme ve Tahmin

Düşük maliyetli sensör ağları şimdi hiperyerel hava kalitesi verileri sağlar. Bir Spark boru hattı, PM2.5'in en fazla 24 dakikalık okumalarını sağlayabilir, PM10, NO2, O3 ve meteorolojik değişkenler.With Spark SQL, mühendisler ortalamaları hesaplayabilir, tahminleri bir makine öğrenme modeline girebilir ve 24 ila 48 saat öncesine kadar besleyebilir.

Su Kalite Analizi

Su kalitesi veri setleri pH, turbidity, çözünmüş oksijen, ağır metaller ve bakteri sayılıyor. Spark'ın DataFrame API, zaman pencereleri üzerinde agresyon gösteren aggregasyonu basitleştirir (örneğin, günlük ortalamaları izleme istasyonu).

Atık Yönetimi Optimizasyonu

Akıllı atık binleri dolum seviyesi sensörleri ile akış verileri üretir. Spark, toplama rotalarını optimize etmek için oranları analiz edebilir, yakıt tüketimi ve emisyonlarını azaltır. Tarihsel veriler, yüksek atık nesil dönemlerini tahmin etmek için kullanılabilir, belediyelerin bin yerleştirme planlarını ayarlamasına izin verebilir. Graph algoritmaları trafik modellerini göz önünde bulundurmak için en kısa yolları hesaplayabilir.

İklim ve Meteorolojik Veri Analizi

İklim modelleri büyük şebekeli veri kümeleri üretir. Spark, Hadoop giriş biçimleri aracılığıyla NetCDF ve HDF5 dosyalarını okuyabilirsiniz, uzaysal olarak bölge sınırlarına katılır ve istatistiki (örneğin, ortalama sıcaklık anomalileri ülke başına).

Gürültü Kirliliği Haritası

Kentsel gürültü izleme ağları sürekli decibel-düşük okumalar yaratır. Spark, bu akışları trafik ve hava verilerinin gürültü haritalarını oluşturmak için birlikte yürütebilir. Anomaly algılama inşaat patlamalarını veya acil araç sirenslerini tanımlar. Long-term trendleri kentsel planlayıcıların gürültü mitigation önlemleri değerlendirmelerine yardımcı olur.

Biodiversity ve Ekosystem İzleme

Kamera tuzakları ve akustik sensörler yüksek görüntü ve ses verileri üretir.Koca derin bir öğrenme çerçevesi olmasa da dış araçlar için işlem öncesi veriler (örneğin, yeniden boyut görüntüleri, spektrogramlar) MLlib'in özelliği, nüfus dinamikleri için türlerin sınıflandırma modelleriyle bir araya gelir.

Teknik Uygulama: Gerçek Zamanlı Çevre Veri Boru Hattı Oluşturma

Spark'ın yeteneklerini göstermek için, bir metropol alanı için gerçek zamanlı bir hava kalitesi izleme sistemi düşünün. Boru hattı dört aşamadan oluşur: ingestion, streaming processing, storage, and visualization.

Aşama 1: Apache Kafka ile Data Ingestion

Binlerce düşük maliyetli sensör PM2.5, sıcaklık, nem ve GPS her dakika koordinatlar yapar. Veriler MQTT veya HTTP aracılığıyla JSON formatında gelir. A Kafka kümesi (korumak için) bir tampon olarak davranır, hiçbir verinin düşük frekanslı tüketiciler başarısız olsa bile kaybedilmesini sağlar. Spark Streaming, Kafka konuları kullanarak okur.

Aşama 2: Yapılı Akışla Akış İşleme

Spark'ın Yapılı Akışı (Prapark'ta kullanılabilir), gelen veriler sütunlarla bir Veriye dönüştürüldü: “Üyetim: “Üyetim:2., [[Üyetim: 03.03.2012, [[Üye Olmayanlar, A.D.D.D.D.D.D.D.D.D.D.D.D.D.D.D.D.D.D.D., [[)

df = spark.readStream \
 .format("kafka") \
 .option("kafka.bootstrap.servers", "localhost:9092") \
 .option("subscribe", "air-quality") \
 .load()

Buradan, mühendisler dönüşümleri uygular: Geçerlilik (daha yakın mahalleye doğru olmayan değerlerin aksine) YERSİ (örneğin, 55 μg/m3 ( EPA, 1 saat standart), bir uyarı servisine uyarı gönderir (en yakın bir mahalleye karşı jeokoding).

Aşama 3: Depolama ve Tarihsel Analiz

Temizleştirilmiş ve agred veriler Apache Parkt gibi bir sütun mağazasına yazılır ve ardından gerçek zamanlı tahminler üretmek için akış işine yüklenebilir. Örneğin, Spark SQL, Park dosyaları doğrudan kontrol, endüstri veya vahşi yangınlar ile ilgili olarak kaynaklama modellerini sorgulayabilir.

Aşama 4: Görselleştirme ve Dashboards

Spark'ın çıkışı, her dakika şehir genelinde hava kalitesi ile ilgili olarak Apache Superset veya Grafana gibi görselleştirme aracına doğrudan PostgreSQL veritabanına yazılabilir ve tarihi eğilimlerin zaman serisi grafikler olarak gösterilmesine izin verebilir.

Vaka Çalışması: Akıllı Şehirde Gerçek Zaman Kirliliği Tespiti

Orta büyüklükte bir Avrupa şehri 100 km2'de 500 düşük maliyetli hava kalitesi sensörleri dağıtmıştı. Daha önce, veriler her saat ve toplu işbirlikleri bir gecede toplanmıştı, yani bir fabrika arızasından kaynaklanan kirlilik artışları 12 saat çok geç rapor edildi.

Sistem bir Pazar öğleden sonra bir inşaat sitesinden PM2.5 artış tespit etti.Mantık 30 saniye içinde, sensörin 100 μg/m3'ün üzerinde okuduğunu, SMS uyarılarının çevresel koruma ajansına ve inşaat sitesi yöneticisine gönderildiğini tespit etti. Sürekli geri bildirimler, iyilerden sonra% 40'lık bir azalmaya yol açtı.

Bu durum, Spark'ın akış kombinasyonu, SQL ve ML yeteneklerinin nasıl uygulanabilir bir zekaya dönüşebileceğini gösteriyor.

Çevre Data için Spark ile başlayın

Yeni mühendisler için, aşağıdaki yol haritası kabul edilebilirliği hızlandırır.

Adım 1: Bir Geliştirme Çevresini Belirle

Tek bir bilgisayar kullanımı üzerine bir bilgisayar yüklemesi ile başlayın:0)Apache Spark indirmeleri[*)) tarafından silinen bir ortam için Docker kullanın: 03.Apache Spark indirs[*) Amazon EMR gibi bulut hizmetleri düşünün (ki bu, Spark, Hive ve HBase) manuel küme yönetimden kaçınmak için.

2. Adım: En büyük Örnek Çevre Data

Açık veri setlerini, [[GÖRÜSÜŞÜNÜSÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜ

Adım 3: Write Streaming Borus

Basit bir kaynakla Spark Structured Streaming kullanın (örneğin, ağ soketlerinden veya yeni bir CSV dosyaları ile bir klasörden okuyun). Simulate sensör verileri JSON kayıtlarını yerel Kafka örneğine yayan bir akış oluşturun.

Adım 4: Tümleştirici Makine Öğrenme

Basit bir regresyon modeli (örneğin, MLlib ile lineer regresyon) PM2.5'i sıcaklık ve nemden tahmin etmek için tarihsel veriler üzerinde bilgilendirmek ve gerçek zamanlı olarak gelen verileri elde etmek için bir akış işi yükleyin.

Adım 5: Görselleştir ve Automate

Bir Natasha veya PostgreSQL veritabanına yönelik bir BI aracı yazın. Apache Superset veya Grafana gibi bir BI aracı kullanarak veritabanınıza gidin ve panolar oluşturun.Programlar Apache Airflow ile gece ve akış modelini güncelleyin.

Meydanlar ve Mitigation Strategies

Spark güçlü yetenekler sunarken, çevresel mühendisler ortak zorlukların farkında olmalıdır.

Data Quality and Outlier

Sensör sürüklenme, iletişim gürültüsü ve vandalizm, akış boru hattında sağlam geçerliliği mantığı üretebilir: Fiziksel olarak olası aralıklar dışında değerleri reddeder, medya filtrelerini uygular ve sıfır varyan ile bayrak sensörleri kolayca kullanılabilir.

Latency vs. Throughput Trade-offs

Mikro-batch işleme (düşmanlıkta), 10 saniyenin latiyonlarını tanıtmaktadır. Alt saniyelik yanıt için sürekli işlem (experimental) veya Apache Flink gibi düşük ücretli bir motorla birlikte, 10 saniyenin son derece analiz için ısınırsak analiz için uyarıda bulunulabilir.

Bulut Deployments'da Maliyet Yönetimi

Spark kümeleri boş bir şekilde çalıştırılırsa pahalı olabilir. Otomatik ayarlı (örneğin, EMR, ölçeklendirme) düğümleri sadece üst yüklerde eklemek için.

Güvenlik ve Uyum

Çevre verileri gizlilik yasalarına tabi olabilir (örneğin, GDPR eğer konum verileri dahil edilirse) veya uyumluluk gereksinimleri (örneğin, EPA raporlama) Kombine geri ve transit geçişte şifreleme ile ayarınızı güvenli kullanın.Use Spark'sASIFLT:17 API to Maske veya agreyemeden önce kişisel olarak tanımlanabilir bilgiler kullanın.

Çevre izlemenin geleceği, Spark ve kenar hesaplamaları arasında sıkı bir entegrasyon görecek. Ağ geçidi cihazları üzerinde işlem (örneğin, TensorFlow Lite veya Apache Edgent) kullanarak, Spark kümesine ulaşmadan önce veri hacmini azaltabilecektir. Spark daha sonra çapraz-sensor analizine, uzun vadeli trend algılamaya ve modelleme eğitimine odaklanacaktır.

Görüntü ve ses analizi için derin öğrenme modelleri (örneğin, seslendirmelerden kuş türü tanımlamak) genellikle GPU kümeleri gerektirir. Hidrojen ve Horovod, GPU'larda derin öğrenme eğitimi dağıtmaya izin verir. Bu arada, Spark'ın ana desteği, karma bulut ortamlarındaki dağıtımları basitleştirir.

Başka bir eğilim, gerçek zamanlı sensör beslemelerinin ve onları simülasyon modellerine (örneğin, hava dağılımı için gerekli olan) görerektir. - Bu simülasyonlar, çevresel sistemlerin sanal kopyaları. Spark, saatlerden dakikalara kadar uzanan arka kemiği güçleyebilir.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Apache Spark, çevresel mühendislerin, birleştirilmiş bir platformla birlikte, analiz etmesini ve insan sağlığını ve doğal dünyayı koruyan daha doğru karar verme konularında hareket etmesini sağlar.

Spark'ı benimsemeye göre, çevresel mühendislik takımları parçalanmış, toplu odaklı bir araç zincirlerinden uzaklaşabilir ve gerçek zamanlı olarak bilgi veren bir boru hattını kucaklayabilir.Küçük pilotlarla başlayın, açık verilerden yararlanın ve sensör ağları genişletildiği gibi ölçeklendirmek.