Sidar Deniz
← Tüm Yazılar
PythonVeri AnaliziPandas

Python ile Veri Analizi: Pandas Kütüphanesi

Python ile Veri Analizi: Pandas Kütüphanesi

Python'un en güçlü yanlarından biri veri analizi ve veri bilimi alanındaki zengin kütüphane ekosistemidir. Bu kütüphaneler arasında Pandas, veri manipülasyonu ve analizi için vazgeçilmez bir araçtır. Bu yazıda, Pandas kütüphanesinin temel özelliklerini ve kullanım alanlarını inceleyeceğiz.

Pandas Nedir?

Pandas, Python programlama dili için geliştirilmiş açık kaynaklı bir veri analizi ve manipülasyon aracıdır. İsmi "Panel Data"nın kısaltmasından gelir. Pandas ile:

  • Büyük veri setlerini kolayca okuyabilir ve yazabilirsiniz
  • Verileri filtreleyebilir ve sıralayabilirsiniz
  • Farklı veri setlerini birleştirebilirsiniz
  • Eksik verileri tespit edip düzeltebilirsiniz
  • Verileri görselleştirebilirsiniz

Temel Veri Yapıları

Pandas'ın iki temel veri yapısı vardır:

1. Series

Tek boyutlu, indekslenebilir bir veri yapısıdır. Bir Python listesi gibi düşünebilirsiniz, ancak daha fazla özelliğe sahiptir.

import pandas as pd

# Series oluşturma
seri = pd.Series([10, 20, 30, 40, 50])
print(seri)

2. DataFrame

İki boyutlu bir veri yapısıdır. Excel tablosuna benzer şekilde satır ve sütunlardan oluşur.

# DataFrame oluşturma
data = {
    'isim': ['Ali', 'Ayşe', 'Mehmet'],
    'yaş': [25, 30, 35],
    'şehir': ['İstanbul', 'Ankara', 'İzmir']
}
df = pd.DataFrame(data)
print(df)

Veri Okuma ve Yazma

Pandas, birçok farklı formattaki veriyi okuyabilir ve yazabilir:

# CSV dosyası okuma
df = pd.read_csv('veriler.csv')

# Excel dosyası okuma
df = pd.read_excel('veriler.xlsx')

# CSV olarak kaydetme
df.to_csv('yeni_veriler.csv')

Veri Analizi Örnekleri

Temel İstatistikler

# Sayısal sütunların istatistiksel özeti
print(df.describe())

# Sütunların veri tipleri
print(df.dtypes)

# Eksik değerlerin kontrolü
print(df.isnull().sum())

Veri Filtreleme

# Yaşı 30'dan büyük olanları filtreleme
yasli_kisiler = df[df['yaş'] > 30]

# İstanbul'da yaşayanları filtreleme
istanbul = df[df['şehir'] == 'İstanbul']

Gruplama ve Özetleme

# Şehirlere göre yaş ortalaması
sehir_yas = df.groupby('şehir')['yaş'].mean()

# Şehirlere göre kişi sayısı
sehir_sayisi = df['şehir'].value_counts()

İyi Uygulamalar

  1. Veri Temizliği: Analize başlamadan önce verinizi temizleyin

    # Eksik değerleri doldurma
    df.fillna(0)  # veya
    df.dropna()  # eksik değerleri silme
    
  2. Veri Tipi Kontrolü: Doğru veri tipleriyle çalıştığınızdan emin olun

    # Veri tipini değiştirme
    df['tarih'] = pd.to_datetime(df['tarih'])
    
  3. Bellek Optimizasyonu: Büyük veri setleriyle çalışırken bellek kullanımını optimize edin

    # Veri tiplerini optimize etme
    df = df.astype({'kategori': 'category'})
    

Sonuç

Pandas, veri analizi süreçlerini büyük ölçüde kolaylaştıran güçlü bir kütüphanedir. Temel özellikleri öğrendikten sonra, daha karmaşık analizler için sklearn, matplotlib gibi diğer kütüphanelerle birlikte kullanabilirsiniz.

Veri analizi yolculuğunuzda başarılar!