Çevre mühendisliği projeleri, özellikle atık yönetimine odaklandılar, giderek artan veri yoğun. Modern atık sistemleri büyük bilgi akışları üretiyor - sensör destekli binler ve GPS rotalı koleksiyon araçlardan gaz monitörlerine ve vatandaş raporlama uygulamaları. Bu verileri verimli bir şekilde optimize etmek için işlemeye çalışır, Spark, çevresel mühendislerin buluşmak için daha hızlı bir şekilde, daha güvenli bir şekilde uygulanan bir hesaplama çerçevesi olarak ortaya çıktı.Bu ölçek işlemeye uygun şekilde uygulanan bir analiz için en iyi şekilde kullanılmasını sağlar.

Apache Spark'ı Çevre Mühendisliğinin Context of Environmental Engineering

Apache Spark açık kaynaktır, dağıtık veri paralelliği ve hata toleransı ile tüm kümeleri programlamak için bir arayüz sağlayan dağıtılmış bir bilgisayar sistemidir.In çekirdeği, Spark, Resilient Dağıtım DataFLT (RDD), ancak en pratik çalışma daha yüksek seviyeli kütüphaneler aracılığıyla yapılır: 0.Spark) yapılandırılmış veriler için[B][B][D][D][D][FONT][FONT][FONT][FONT][FONT][FONT][FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT

Hadoop MapReduce'nin aksine, ara sonuçları diske yazar, Spark I/O havalimanlarından gelen CSV dosyaları içeren, veri kümesindeki çevresel mühendislik projeleri için özellikle değerlidir ve sonra yüksek hacimli bir algoritmayı çalıştırın - tüm IoT sensörlerinden yarı yapılandırılmış GIS veri ve metin loglarından daha hızlı siparişler alan bir Spark uygulaması. Tipik bir atık analizi boru hattı, onları Parkt'ta bulunan geospatial verilerle birlikte çalışarak, bilgi birikimine katılmak, veri toplama işlemine katılmak ve sonra kümeleme işlemine katılmak anlamına gelir.

Çevre mühendisleri için yeni bir hesaplama için, öğrenme eğrisi yönetilebilir. Spark'ın DataFrame API (similar to pandas) ve SQL arayüzü bariyeri azaltırken, altta küme YARN, Kubernetes veya bulut hizmetleri ile yönetilen olabilir.

Data Sources and Challenges in Waste Management

Modern atık yönetim sistemleri kentsel çevrenin sensörleridir. Tipik veri kaynakları şunları içerir:

  • [FONT:0)Smart bin sensörleri: [Dönetici: 0: 1) Ultrasonik veya kızılötesi dolum seviyesi dekleyiciler LoRaWAN veya hücresel ağlar aracılığıyla okumalar gönderiyor.
  • [0]GPS koleksiyon araçları üzerinde takip ediyor: Gerçek zamanlı yer, hız ve rota bağlı veri.
  • [0] Geri dönüşüm arabalarında RFID etiketleri: Ev veya ticari birim başına ağırlık ve koleksiyon frekansı.
  • [FONT:0]Landfill and transfer istasyonu ölçekleri:[Döneci: [Döne gelen atık tonaj, kompozisyon sensörleri (örneğin, malzeme tipi için yakın).
  • [FONT:0)Environmental izleme istasyonları: Methane, leachate seviyeleri, hava kalitesi yakın sitelere.
  • [FONT:0]Citizen geri bildirim platformları:[Dönetici:[Dönetici:0)[Dönder:[Döneticiler, hizmet talepleri ve sosyal medya veya özel uygulamalardan gelen duygular.

Bu kaynaklar farklı ve konumlarla veri üretir, hacimler ve çeşitleri. Sensör okumaları her birkaç dakikada gelebilir, günde milyonlarca kayıt oluşturabilirken, arazi dolum raporları genellikle haftalık olarak yüklenir. Data kalitesi kalıcı bir meydan okumadır: ölü sensörlerden eksik değerler, GPS sürüklenme ve tutarsız zamanlar.

Excel veya temel Python senaryoları gibi geleneksel ilişkisel veritabanılar ve tek hazır araçlar, bu heterojen verileri verimli bir şekilde işlemek için gerekli altyapıyı sağlar. Spark'ın paralel işleme modeli, veri göllerinden (S3, HDFS) okumak için yerleşik desteği ile birlikte ve akışlar, bu heterojen verileri etkin bir şekilde işlemek için gerekli altyapı sağlar.

Atık Data Integration ve İşleme için Spark uygulayın

Data Ingestion with Structured Streaming

Spark'daki yapılı bir veri akışının sürekli veri akışlarının işlenmesine izin verir.Apol yönetimi için, bu, Kafka veya MQTT'den gelen sensör güncellemelerini okuyan bir boru hattını tanımlayabilir, gerçek zamanlı dönüşümleri gerçekleştirmek (örneğin, ham gerilim okumalarını yüzdeleri doldurmaya dönüştürür), ve topluca veri kümesine de sabitleyebilir. Örneğin, bir şehirdeki akıllı bin ağı, Spark Streaming'ı gerçek zamanlı analiz için 90'ı daha fazla doldurmayı sağlayabilir.

Data Temizlik ve Dönüşüm

Raw atık verileri nadiren analiz edilir. Spark, UDFs kullanarak güçlü veriFrame işlemleri sağlar: uygulamadan önce mantıksal bir plan haline gelir, bu da karmaşık temizlik zincirlerinin kümeleri kullanarak verimli bir şekilde çalıştırılabilir.Delta Lake) (en ACID-compli depolama katmanı ile tüm dönüşümler, doğrulayıcı bir şemalar için etkili bir şekilde çalışır.

Exploratory Data Analysis with Spark SQL

Veriler temizlendiğinde, Spark SQL, mühendislere standart SQL sorguları kullanarak atık desenlerini hızla keşfetmelerini sağlar. Örneğin, koleksiyonun rotaları ile bin dolum seviyelerinin hangi mahallelerin altında olduğunu ortaya koyar.Gruplama atıkları ilkbaharda artan inşaat külleri gibi trendleri çalıştırma yeteneği, sonuçlar doğrudan not defteri aracılığıyla görselleştirilebilir.

Predictive Analytics için Makine Öğrenme

Spark'ın MLlib kütüphanesi, sık sıkılmış algoritmaların ölçeklenebilir uygulamaları sunar: K-meanslar, atık nesil bölgeleri tanımlamak için kümeleme, rastgele ormanlar hafta içi limitleri tahmin etmek için limitleri tahmin etmek ve sensör verilerinin boyutlandırılması için temel bileşen analizi. Zaman serisi tahmin etmek için mühendisler Spark'ın ARIMA'yı kullanabilir veya Pandas UDFs aracılığıyla kütüphaneleri bir araya getirebilir.

Çevre Mühendisliğinde Vakaları Kullanın

Koleksiyon Operasyon Operasyonları Gerçek Zaman İzleme

Orta büyüklükte bir şehir, ortalama% 85'i takip eden ve değişim oranını izlemek için Spark Structured Streaming'ı kullandı (aslıtlı doldurma) Uyarılar her 10 dakikayı yeniden yükleyenler, bu sistem, ortalama% 40'ı aştı ve operasyonel maliyetleri ve vatandaşların şikayetlerini yüzde 18'i düşürdü.

Rota Optimizasyonu GraphX

Atık toplama rota planlama, zaman pencereleri (VRPTW) ile klasik bir araç yönlendirme problemidir.Komşunun GraphX kütüphanesi, Google ORTA'lar veya uzman çözücüler gibi optimizasyon araçları için tasarlanmamıştır.Bir durumda, büyük bir grafik yapısı (örneğin, trafik verileri ile yol ağları) hesaplayarak, bir metropolün arsaları arasındaki en kısa mesafeleri hesaplamak için tasarlanmış ve gecikmeli matriksleri azaltmak için,% 75 oranında yeniden planlanabilir.

Atık Üretiminin Tahmini Modeling

Bölge seviyesindeki atık üretimi doğru tahmin, belediyelerin tüm kaynakları verimli bir şekilde tahsis etmelerine olanak sağlar. Tarihi koleksiyon verileri demografik, hava ve ekonomik göstergeler ile birlikte, mühendisler bir Spark MLlib gradient-boosted ağaç modeli kurdular. Model haftalık atık hacimleri% 91 oranında tahmin etti (R2) arazi ve geri dönüşüm programları için bütçeleme ve ayrıca "pay-as-you-throw" fiyatlandırma modellerini destekledi. Çünkü model, yeni veri manuel müdahale olmadan tekrar eğitilebilir.

Vatandaş Geri Bildirim Analizi

Çevre mühendisliği tamamen teknik değildir - halk algısı önemlidir. Spark'ın doğal dil verilerini işlemek için mümkün kılar (örneğin, kaçırılır, döküntü, koku, gürültü) ve bu işlemden sonra yapılan araştırmalarla birlikte, MLlib'in lojistik geri dönüşümlerini veya önceden eğitilmiş bir NLP modelinin kullanılması, bir tatil haftası boyunca geri bildirimde bulunulabilir.Bu derlemede yapılan bir analize yol açabilir.

Üretim için Mimari Yönleri

Cluster Ayarları ve Kaynak Yönetimi

Atık yönetim projeleri için, Spark kümeleri iş yüküne dayalı olarak basitleştirilmiş politikalar dağıtılabilir. Anahtar yapılandırma parametreleri, meta donanım veya bulutta elastik ölçeklendirme için bulutta kullanılabilir. Cloud services like Amazon EMR, Google Dataproc, or Databricks setting management and provide auto-scaling policies based on workload. Key configuration values includeUVT:0spark.executor.memory) (tipik olarak 10 saniye) ve 10 saniye boyunca bilgisayar ağları için en aza indirmek için).

Depolama Biçimlerini Seçme

Apache Parkt gibi köşe biçimleri, atık verileri için şiddetle tavsiye edilir. Parkt verimli bir şekilde sıkıştırılır (örneğin, bir veri gölünün esnekliği ile bir veri deposunun şemalarını birleştiren birçok belediye daha fazla güvenilir hale getirir - Spark bu mimari için gerekli sütunları okur.

Edge Lakes ile bütünleşmek

Bazı dağıtımlarda, tüm ham verileri, bu cihazlardan dolayı merkezi bir kümeye göndermek için pratik değildir, temel temizlik ve pencereli işlemler gerçekleştirmek için hafif bir Spark işi yürütmektir (örneğin, transfer istasyonlarındaki temel ağ geçidine göre) önceden işlem ve özetlemek, ağ göndermeden önce yerel olarak özetlemek ve yakın zamanda doğru zaman kararları vermek için.

Meydanlar ve Çözümler

Gücüne rağmen, Spark bir gümüş mermi değildir. Ortak bir meydan okuma, RD tabanlı koddaki özel bölümler kullanılarak (DataFrame API'leri otomatik olarak ele aldığında) diğer bazı bölümlerde yüksek oranda yoğunlaşır.[DD-düşükümlü görevlerde kullanılan çözümler için çözümler içerir.[D-batıklama modeli, bazı ikinci kontroller için en az gecikmeli olan sanal makineler için en az gecikme süresine sahiptir.

Maliyet yönetimi, kamu tarafından finanse edilen çevresel projeler için önemlidir. 7/24 büyük bir kümeyi çalıştırın. Boşluk veya nokta örneklerini kullanarak iş performansını şişe ve doğru büyüklükteki kaynakları tanımlamak için izlemeleri gerekir. Spark'ın kontrol noktası ve spekülatif infazı bu riski azaltır.Ek olarak, otomatik olarak ödeme maliyetleri azaltır. Takımlar, Ganglia veya Spark UI gibi iş performanslarını şişeleri ve doğru büyüklükteki kaynakları tanımlamak için izlemeli.

Beceri boşluğu başka bir engeldir. Çevre mühendisleri genellikle alan bilimi üzerinde eğitilmiştir, hesaplamayı dağıtmaz.Ppark ve temel küme yönetimi için eğitimde yatırım yapmak veya veri mühendisliği takımları ile ortak olmak önemlidir. Birçok bulut sağlayıcı, bilgisayar hizmetlerine soyut bir altyapı sağlar, mühendisler küme yapılandırmadan ziyade analiz mantığına odaklanır.

Çevre Mühendisliği Takımları için En İyi Uygulamalar

  • [FONT:0] Pilot proje ile başlayın[Dönetici: 1 ) – bir atık akışı (örneğin, ticari geri dönüşüm) ve geniş çapta ölçeklendirmeden önce bir kanıt-konsepsiyon oluşturmak için tek bir veri kaynağı seçin.
  • [FONT:0] Spark işleri için sürüm kontrolü [Dönetici: 1) - Kod olarak notlar tedavi; Git ve CI /CD'yi test etmek ve boru hatları dağıtmak için kullanın.
  • [FONTNT=0)Implement şema evrimi[[[Dönetici: 1) Delta Lake veya euro'yu zamanla sensör veri formatlarında değişiklikler yapmak için kullanın.
  • [FONT=0)Instri data management[[[Dönetici:0)[FONT][/FONT=FONT=FONT=0) ve saklanmadan önce maskeleme veya aggregasyon uygulayın.
  • [FONT=0) Operasyonel ölçümler[[Döneticiler[Döneticiler, veri hacmi ve hata oranları takip edin; boru hatları için uyarılar oluşturun.
  • [FONT:0)Komisyon uzmanlarıyla işbirliği[[Dönetici: 1 ) - anlamlı KPI'ları tanımlamak ve modelleme model çıktılarını uygulamak için atık yönetim operatörleri içerir.
  • [FONT=0]Benchmark against baseline systems[Dönetici] - Spark'ın performansını mevcut yaklaşıma kıyasla (örneğin, bir PostgreSQL veritabanı) geliştirmelerini ölçmek için.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Apache Spark, çeşitli ve yüksek hacimli verileri optimize etmek için sağlam, ölçeklenebilir ve maliyet-aktif bir platform sunuyor.Modern atık yönetim sistemleri tarafından üretilen verileri optimize etmek için, uygulamaları azaltılabilir maliyetlerde, daha düşük emisyonlar ve geliştirilmiş hizmette, veri skew, çevresel mühendisler çiğ sensör okumalarını ve beceri gereksinimleri dönüştürmek için kullanılabilir.

[0] Daha fazla okuma için Dış kaynaklar:

  • [FONT=0]Apache Spark Resmi Dokümantasyon[Dönem: 1) Kurulum, ayar ve API'ler üzerinde kapsamlı kılavuzlar.
  • [FONT:0) Gerçek zamanlı atık yönetimi IoT ve Spark kullanarak (IEEE kağıt)) - Spark akışı ile akıllı bir bin sistem üzerinde bir araştırma örneği.
  • [FONT:0)Databricks Blog: Smart City Waste Reduce[DÜT:1) - Delta Lake ve MLlib'i rota optimizasyonu için kullanarak yayınlanan bir vaka çalışması.
  • [FONTA Atık Yönetimi Araştırması[[Dönetici:0) [FONTA Atık Yönetimi Araştırması[[Dönetici: 1)