Yapay Zeka Kütüphanesi
HAZIRPROMPTLAR
Bildirimler

Son eklenen içerikler

Veri Analizi

Veri Temizleme ve Ön İşleme Süreçleri Kapsamlı Rehberi

Veri Temizleme ve Ön İşleme Süreçleri Kapsamlı Rehberi Veri analizinde en sık duyulan cümle şudur: "Analiziniz yalnızca veriniz kadar iyidir." Ham verinin doğrudan analiz süreçlerine sokulması; yanıltıcı sonuçlara, hatal...

9 dakika okuma 236 görüntülenme 27 Şub 2026

Puan ver

Henüz puan yok

Paylaş

Veri Temizleme ve Ön İşleme Süreçleri Kapsamlı Rehberi

Veri analizinde en sık duyulan cümle şudur: "Analiziniz yalnızca veriniz kadar iyidir." Ham verinin doğrudan analiz süreçlerine sokulması; yanıltıcı sonuçlara, hatalı kararlara ve güvenilmez raporlara yol açar. Gerçek dünyada toplanan verilerin büyük çoğunluğu eksik değerler, tutarsız formatlar, aykırı gözlemler ve mükerrer kayıtlar barındırır. Bu nedenle veri temizleme ve ön işleme, herhangi bir analiz projesinin en kritik ve zaman alıcı aşamasını oluşturur.

Bu rehberde, ham veriyi analiz edilebilir hale getirmek için izlemeniz gereken sistematik adımları, kullanabileceğiniz araçları ve AI destekli prompt tekniklerini ayrıntılı biçimde ele alacağız. İster Excel kullanıyor olun, ister Python ya da SQL; bu süreçlerin temel mantığı her platformda aynıdır.

Veri Kalitesi Neden Bu Kadar Önemlidir

Bir veri setinin kalitesi birkaç temel boyutla ölçülür: doğruluk, tutarlılık, eksiksizlik, teklik ve geçerlilik. Bu boyutlardan herhangi birinde yaşanan sorun, tüm analiz sürecini kirletebilir.

  • Doğruluk: Veri gerçeği yansıtıyor mu? Yanlış girilmiş bir telefon numarası veya ters yazılmış bir tarih, segmentasyon analizini tamamen bozabilir.
  • Tutarlılık: Aynı bilgi farklı kaynaklarda farklı formatlarda mı tutuluyor? "TR", "Türkiye" ve "Turkey" aynı ülkeyi temsil etse de sistem bunları farklı kategoriler olarak okur.
  • Eksiksizlik: Eksik değerler analiz sonuçlarını ciddi ölçüde etkiler; özellikle yüzde hesaplamalarında ve makine öğrenmesi modellerinde.
  • Teklik: Mükerrer kayıtlar, satış raporlarında sahte bir büyüme yanılsaması yaratabilir.
  • Geçerlilik: Değer mantıklı bir aralıkta mı? Yaş sütununda 250 değeri görmek açıkça bir veri girişi hatasına işaret eder.

💡 İpucu: Bir veri projesine başlamadan önce "veri kalite raporu" hazırlayın. Bu rapor; eksik değer oranlarını, benzersiz değer dağılımlarını ve aykırı gözlem sayılarını içermelidir. Bu adım, ilerleyen süreçte sizi büyük zaman kayıplarından kurtarır.

Eksik Veri Tespiti ve Yönetimi

Eksik veriler (missing values) üç farklı mekanizmayla ortaya çıkar: tamamen rastlantısal kayıp (MCAR), rastlantısal kayıp (MAR) ve rastlantısal olmayan kayıp (MNAR). Bu mekanizmayı anlamak, doğru stratejiyi seçmek açısından belirleyicidir.

Eksik Veri Stratejileri

Eksik verilerle başa çıkmak için dört temel yaklaşım mevcuttur:

  1. Silme (Deletion): Eksik değer içeren satır veya sütunlar veri setinden çıkarılır. Eksiklik oranı yüzde beşin altındaysa ve verinin MCAR olduğu biliniyorsa makul bir seçenektir.
  2. Ortalama / Medyan / Mod ile Doldurma: Sayısal sütunlarda ortalama ya da medyan, kategorik sütunlarda ise en sık görülen değer (mod) kullanılır.
  3. İleri / Geri Doldurma (Forward / Backward Fill): Zaman serisi verilerinde, bir önceki veya sonraki geçerli değer eksik hücreye atanır.
  4. Model Tabanlı Atama (Imputation): KNN gibi algoritmalar kullanılarak eksik değer tahmin edilir. Karmaşık veri setlerinde daha güvenilir sonuçlar verir.

⚠️ Uyarı: Ortalama ile doldurma, dağılımı bozabilir ve varyansı yapay olarak düşürür. Eksiklik oranı yüzde onun üzerindeyse model tabanlı yöntemlere geçmeyi değerlendirin.

Aşağıdaki Python kodu, bir veri setindeki eksik değerleri analiz etmek ve görselleştirmek için kullanabileceğiniz temel bir yapıyı göstermektedir:

import pandas as pdnimport matplotlib.pyplot as pltnndf = pd.read_csv("veri.csv")

# Eksik değer oranlarını hesaplaneksik_oran = df.isnull().mean() * 100neksik_oran = eksik_oran[eksik_oran > 0].sort_values(ascending=False)nnprint("Sütun bazlı eksik veri oranları (%):
")nprint(eksik_oran)

# Sayısal sütunları medyan ile doldurnfor sutun in df.select_dtypes(include=["float64", "int64"]).columns:n df[sutun].fillna(df[sutun].median(), inplace=True)

# Kategorik sütunları mod ile doldurnfor sutun in df.select_dtypes(include=["object"]).columns:n df[sutun].fillna(df[sutun].mode()[0], inplace=True)nnprint("
Eksik değerler temizlendi. Kalan eksik değer sayısı:", df.isnull().sum().sum())n

Aykırı Gözlem Tespiti ve Düzeltme

Aykırı değerler (outliers), veri setinin genel dağılımından belirgin biçimde uzak gözlemlerdir. Bunlar bazen gerçek ve anlamlı olayları temsil eder (örneğin olağandışı bir satış zirvesi), bazen ise veri giriş hatasının ürünüdür. İkisi arasındaki farkı kavramak, analitik yargı gerektirir.

Aykırı Değer Tespit Yöntemleri

  • IQR (Çeyrekler Arası Açıklık) Yöntemi: Q1 - 1.5×IQR altındaki ve Q3 + 1.5×IQR üstündeki değerler aykırı kabul edilir. Dağılımdan bağımsız çalıştığı için geniş kullanım alanı bulur.
  • Z-Skoru Yöntemi: Ortalamadan 3 standart sapma uzaktaki değerler aykırı sayılır. Normal dağılıma yakın verilerde etkilidir.
  • Görsel İnceleme: Box plot ve scatter plot grafikleri, aykırı değerleri sezgisel biçimde ortaya koyar.

💡 İpucu: Aykırı değerleri doğrudan silmek yerine önce kaynağını araştırın. Bir e-ticaret veri setinde çok yüksek bir sipariş tutarı, toplu satın alma veya kurumsal müşteri gibi geçerli bir senaryoya işaret edebilir.

Veri Dönüştürme ve Standardizasyon

Ham verinin analiz ya da modelleme için uygun biçime getirilmesi, veri dönüştürme sürecini kapsar. Bu adım; ölçek farklılıklarını gidermek, kategorik verileri sayısala çevirmek ve tarih-saat alanlarını işlenebilir formata almak gibi görevleri içerir.

Yaygın Dönüştürme İşlemleri

  • Normalizasyon (Min-Max Ölçekleme): Değerleri 0-1 aralığına çeker. Farklı ölçeklerdeki değişkenlerin karşılaştırılmasında kullanılır.
  • Standardizasyon (Z-Score): Ortalamayı sıfır, standart sapmayı bir yapacak şekilde dönüştürür. Makine öğrenmesi algoritmalarının çoğu bu formatı tercih eder.
  • Kodlama (Encoding): "Cinsiyet", "Şehir" gibi kategorik değişkenler One-Hot Encoding veya Label Encoding ile sayısala dönüştürülür.
  • Tarih Ayrıştırma: Bir tarih sütunundan gün, ay, yıl, hafta numarası ve mevsim gibi türetilmiş özellikler çıkarılabilir.
  • Metin Temizleme: Büyük-küçük harf standardizasyonu, boşluk silme ve özel karakter temizliği.

AI Prompt Desteğiyle Veri Temizleme Sürecini Hızlandırma

ChatGPT, Claude veya Gemini gibi büyük dil modellerine doğru promptlar yazarak veri ön işleme sürecinizi önemli ölçüde hızlandırabilirsiniz. Bu modeller; Python veya SQL kodu üretme, dönüşüm mantığı tasarlama ve hata ayıklama konularında güçlü bir destek sunar.

Aşağıda, bir AI aracına yöneltebileceğiniz etkili bir veri temizleme promptu örneği yer almaktadır:

Bana bir pandas veri çerçevesi için kapsamlı bir veri temizleme fonksiyonu yaz.
Veri setim şu özelliklere sahip:
- 50.000 satır, 12 sütun
- Sütunlar: musteri_id, ad, soyad, yas, sehir, gelir, siparis_tarihi, urun_kodu, miktar, birim_fiyat, toplam_tutar, durum
- Sorunlar: eksik yas ve gelir değerleri, tutarsız şehir isimleri (büyük-küçük harf karışıklığı), mükerrer musteri_id kayıtları, toplam_tutar sütununda aykırı değerler

Fonksiyon şunları yapmalı:
1. Eksik yaşları medyan ile, eksik gelirleri ortalama ile doldursun
2. Şehir isimlerini title case'e çevirsin ve baştaki/sondaki boşlukları temizlesin
3. Mükerrer satırları kaldırarak ilk kaydı korusun
4. IQR yöntemiyle toplam_tutar aykırı değerlerini işaretleyen yeni bir sütun eklesin
5. Her adımda kaç satırın etkilendiğini raporlasın

💡 İpucu: AI'a veri setinizin yapısını, sütun adlarını ve karşılaştığınız sorunları açıkça tanımladığınızda üretilen kodun kalitesi ve kullanılabilirliği belirgin biçimde artar. Belirsiz promptlar yerine bağlamı zengin promptlar tercih edin.

Temizleme Sonrası Veri Doğrulama ve Belgeleme

Veri temizleme sürecinin son ve çoğu zaman atlanan adımı, yapılan değişikliklerin doğrulanması ve belgelenmesidir. İyi bir veri analistinin sorumluluğu yalnızca veriyi temizlemek değil, bu süreci şeffaf biçimde kayıt altına almaktır.

Doğrulama Kontrol Listesi

  • Tüm sütunlarda eksik değer kalmadığını teyit edin.
  • Sayısal sütunların beklenen aralıkta olduğunu kontrol edin (örneğin yaş 0-120 aralığında).
  • Kategorik değerlerin önceden tanımlı listelerle eşleştiğini doğrulayın.
  • Toplam satır sayısının makul bir değişim gösterdiğini gözlemleyin; aşırı satır kaybı önemli bir uyarı işaretidir.
  • Temizlenmiş verinin dağılım istatistiklerini (describe()) ham veriyle karşılaştırın.

Belgeleme için bir "veri günlüğü" (data changelog) tutmak önerilir. Bu günlük; hangi sütunlarda ne tür temizleme yapıldığını, kaç değerin etkilendiğini ve neden bu yöntemin seçildiğini açıklamalıdır. Özellikle ekip ortamlarında ve tekrarlayan raporlama süreçlerinde bu belge paha biçilemez bir kaynak haline gelir.

⚠️ Uyarı: Ham veriyi asla üzerine yazarak temizlemeyin. Orijinal dosyayı koruyun ve temizlenmiş veriyi ayrı bir dosyaya ya da veritabanı tablosuna kaydedin. Bir hata anında geri dönüş yapabilmek kritik önem taşır.

Verimli Bir Veri Temizleme Alışkanlığı Geliştirmek

Veri temizleme, tek seferlik bir görev değil; sürekli iyileştirme gerektiren bir disiplindir. Her yeni veri kaynağıyla farklı kalite sorunlarıyla karşılaşacaksınız ve zamanla bu sorunları öngörme ve hızlı çözme konusunda bir refleks geliştirmeye başlayacaksınız.

Sürecinizi standartlaştırmak için kendi temizleme şablon kütüphanenizi oluşturun: sık karşılaştığınız sorunlara yönelik yeniden kullanılabilir fonksiyonlar, kontrol listeleri ve AI prompt şablonları hazırlayın. Bu yatırım, her yeni projede size ciddi zaman kazandıracaktır.

Unutmayın: Analiz sürecine harcanan zamanın yüzde yetmişi veri hazırlama aşamasında geçer. Bu süreyi azaltmak değil, daha kaliteli hale getirmek asıl hedefiniz olmalıdır. Temiz veri, güvenilir analizin; güvenilir analiz ise doğru kararların temel taşıdır.

Son güncelleme: 27 Şubat 2026
Faydalı mıydı?

Topluluk Görüşleri

Bu içerik hakkında üyeler neler düşünüyor?

Topluluğa Katılın

Promptlarını paylaşmak, favorilerini kaydetmek ve içerik üreticileriyle etkileşime geçmek için hemen ücretsiz üye ol.

4,329 üye 1,700 yorum 1,133 içerikte tartışma