01KONUM ZEKÂSI / SENTETİK AĞ

Bir adres.
En yakın hub.

Türkiye’deki bir adresi koordinata dönüştürür, sentetik dağıtım ağındaki en yakın operasyon noktasını saniyeler içinde eşleştirir.

Adresler kaydedilmez8 sentetik hubKuş uçuşu mesafe
DENE:

Başlamak için en az 3 karakter yaz.

CANLI HARİTA38.9637, 35.2433
AdresHubDoğrusal mesafeSentetik kapsam
03VERİ MADENCİLİĞİ DERSİ ÖDEVİ

Adres karmaşasından coğrafi bölgelere.

Çalışmanın asıl amacı yalnızca en yakın noktayı bulmak değildi. Gürültülü adres metinlerini normalize edip koordinata dönüştürmek, coğrafi kümeyi belirlemek ve o küme içinde anlamlı bir label tahmini üretmekti.

  1. 01 / HAM GİRDİDağınık adres metinleri

    Serbest yazım, farklı kısaltmalar, tekrarlanan konum ifadeleri ve tahmini zorlaştıran ayrıntılar aynı veri havuzunda bulunuyordu.

  2. 02 / NORMALİZASYONOrtak bir adres dili

    Türkçe karakterler, noktalama, boşluklar ve adres bileşenleri standartlaştırılarak aynı yeri anlatan farklı yazımlar yakınlaştırıldı.

  3. 03 / COĞRAFİ FİLTREDoğrulanmış bölgesel alt küme

    Koordinatı çözülebilen kayıtlar kontrol edildi; çalışma alanıyla ilişkili noktalar seçilerek gürültü ve kapsam dışı kayıtlar ayrıldı.

  4. 04 / MODEL GİRDİSİKonum ve hedef sinyali

    Enlem, boylam ve label ilişkisi modellemeye taşındı. Cluster ise veride hazır gelen değil, analiz sırasında üretilen bir bölge katmanıydı.

Buradaki asıl hikâye kayıt sayısı değil, ham metnin güvenilir bir coğrafi sinyale dönüşmesidir. Gizli satırlar ve gerçek adres örnekleri yayınlanmaz.

A / VERİ

Model hangi sinyalleri kullanıyordu?

Temel kayıt yapısı; serbest biçimli adres metni, hedef label, enlem ve boylam alanlarından oluşuyordu. Adres metni geocode öncesinde Türkçe karakter, kısaltma, noktalama, kat ve daire gibi parçalar için normalize ediliyordu.

  • adres metni
  • latitude
  • longitude
  • label
  • cluster
B / MODEL

Neden iki aşamalı bir tahmin?

İlk aşama koordinatları geniş coğrafi bölgelere ayırarak arama uzayını anlamlı parçalara bölüyordu. Yeni bir nokta, ölçeklenmiş uzayda en yakın bölge merkezine atanıyor; ikinci aşamadaki mesafe ağırlıklı KNN ise daha yerel label tahminini üretiyordu.

20 CLUSTERKNN k=7WARD LINKAGENEAREST CENTROIDMINKOWSKI p=2DISTANCE WEIGHTED
C / MODEL KARARI

Neden 20 cluster?

Bu sayı evrensel bir doğru olarak seçilmedi. Farklı kümeleme yaklaşımları ve bölge sayıları karşılaştırıldı; coğrafi ayrışmayı okunabilir tutan, çok küçük ve dengesiz bölgeleri sınırlayan deneysel bir çalışma noktası olarak kullanıldı.

  • DendrogramDoğal birleşme seviyeleri ve bölge hiyerarşisi okundu.
  • SilhouetteKümelerin kendi içinde yakın, birbirinden ayrık kalması izlendi.
  • DengeAşırı büyük veya çok küçük kümelerin analizi bozması kontrol edildi.
  • KontrolWard yaklaşımıyla bölge sayısı ve sonuçların yorumlanabilirliği korundu.
  1. 01Normalize et

    Türkçe büyük/küçük harfleri, adres kısaltmalarını ve gürültülü işaretleri standartlaştır.

  2. 02Geocode et

    Adres önerisini seç, koordinatı çöz; numarataj bulunamazsa sokak merkezini kontrollü fallback olarak kullan.

  3. 03Cluster ata

    Noktayı ölçekle, 20 merkezle karşılaştır ve en yakın coğrafi cluster’ı belirle.

  4. 04Label tahmin et

    Yedi komşunun uzaklıklarını ağırlıklandır; label, olasılık ve komşuluk mesafelerini üret.

  5. 05Kapsamı gör

    Cluster ve label noktalarından merkez, yaklaşık yarıçap ve nokta sayısı çıkarıp haritada katmanlaştır.

D / DENEYLER

Model karşılaştırması

Deneyler yalnızca “hangi algoritma daha iyi?” sorusuna bakmıyordu. Metin ile koordinatın problemi ne kadar farklı temsil ettiğini de gösteriyordu.

YaklaşımSinyalDeneyden çıkan okuma
KNNKoordinat

Fiziksel yakınlığı doğrudan taşıdığı için en güçlü yerel sinyali verdi ve ikinci aşama için seçildi.

Naive BayesTF-IDF metin

Hızlı bir referans noktası sağladı; birbirine benzeyen çok sayıdaki label arasında ayrım gücü sınırlı kaldı.

Logistic RegressionTF-IDF metin

Yorumlanabilir doğrusal bir temel sundu; yakın sınıfların kelime uzayındaki sınırlarını tek başına ayırmakta zorlandı.

Random ForestTF-IDF + SVD

Doğrusal olmayan ilişkileri denedi; metni yoğun temsile indirgemek bazı seyrek adres sinyallerini kaybettirdi.

Decision TreeTF-IDF metin

Basit bir karşılaştırma modeli oldu; yüksek boyutlu metin uzayında kararlı bir genelleme üretmedi.

E / PUBLIC ÖDEV PAKETİ

Kod, notebook ve sentetik veri birlikte.

Gerçek adres satırları paylaşılmadan ödevin nasıl çalıştığı incelenebilir. Public paket; normalizasyonu, Ward tarzı kümelemeyi, en yakın merkez atamasını ve mesafe ağırlıklı KNN akışını küçük bir sentetik veri üzerinde yeniden üretir.

SENTETİK ÖRNEK / 01Ham metinden model girdisine
HAMÖrnek Mh. Veri Sk. No: 1, İzmir
NORMALİZEörnek mahallesi veri sokagi no 1 izmir
MODELlatitude · longitude · demo_merkez

Bu kayıt ve koordinatlar yalnızca veri biçimini göstermek için üretilmiştir; gerçek kişi veya teslimat verisi değildir.

DERS ÖDEVİNDE

Daha zengin model çıktısı

  • Cluster kimliği ve merkeze uzaklık
  • KNN label ve tahmin olasılığı
  • En yakın / ortalama komşu mesafesi
  • Cluster ve label kapsama yarıçapı
  • Bağlam noktalarıyla katmanlı Folium haritası
YAYIN DEMOSUNDA

Güvenli ürün uyarlaması

  • Gerçek zamanlı adres ve koordinat çözümleme
  • 8 sentetik hub ve açıklayıcı ağ profili
  • Haversine ile şeffaf mesafe sıralaması
  • Gerçek ham veri ve özel eğitim artefact’ı yok
  • Eğitilmiş özel model çalışıyormuş gibi bir iddia yok
04DEMO NASIL ÇALIŞIR?

Model fikrinden güvenli ürün deneyimine.

  1. 01ADRESİ DOĞRULA

    Girilen metni Türkiye adres dizinindeki önerilerle eşleştir; kullanıcı doğru kaydı kendisi seçsin.

  2. 02KONUMU ÇÖZ

    Seçilen adresi sunucu tarafında enlem ve boylama dönüştür; adresi saklama veya loglama.

  3. 03AĞI KARŞILAŞTIR

    Haversine formülüyle sekiz sentetik hub’ı tara; en yakın noktayı ve iki alternatifi sırala.

  4. 04SONUCU AÇIKLA

    Mesafeyi, kapsama profilini, bölge kodunu ve ağ yoğunluğunu birlikte göster; sentetik sınırı görünür tut.