Deep Web Araştırmacılığı: İndekslenmemiş Verilere Ulaşma Yöntemleri

müfettiş

Moderatör
Katılım
20 Ocak 2024
Mesajlar
325
Tepkime puanı
1
Puanları
18
Wikipedia.png.webp


Deep Web Araştırmacılığı: İndekslenmemiş Verilere Ulaşma Yöntemleri​

İnternet hakkında duyacağınız en ünlü metafor "Buzdağı" benzetmesidir.
  • Surface Web (Yüzey Ağ): Buzdağının suyun üstündeki kısmıdır. Google, Bing veya Yandex ile arayıp bulduğunuz her şey buradadır. Tüm internetin sadece %4 ila %10'unu oluşturur.
  • Deep Web (Derin Ağ): Buzdağının suyun altında kalan devasa kısmıdır. İnternetin yaklaşık %90'ı buradadır.
  • Dark Web (Karanlık Ağ): En dipteki, özel yazılımlarla girilen küçük ve tehlikeli kısımdır. (Bunu ilk makalemizde işlemiştik).
Bir OSINT araştırmacısı için asıl maden Dark Web değil, Deep Web'dir. Çünkü şirket raporları, akademik makaleler, devlet kayıtları, uçuş verileri ve hukuki dosyalar burada saklıdır. Ve en güzeli; buraya girmek suç değildir, sadece doğru anahtara sahip olmanız gerekir.

Bölüm 1: Deep Web Nedir? Neden Google Görmüyor?​

Google ve diğer arama motorları "Örümcek" (Spider/Crawler) adı verilen botlar kullanır. Bu botlar linkten linke atlayarak sayfaları indeksler.

Ancak bir botun giremediği yerler Deep Web olarak kabul edilir:
  1. Dinamik İçerik: Sadece bir arama kutusuna bir şey yazdığınızda oluşan sayfalar. (Örn: sahibinden.com'da "2015 model kırmızı araba" araması yaptığınızda oluşan sonuç sayfası Google'da indeksli olmayabilir).
  2. Şifreli/Üyelikli Alanlar: E-posta kutunuz, banka hesabınız, ücretli gazete abonelikleri veya Netflix içerikleri.
  3. İzole Sayfalar: Başka hiçbir siteden link verilmemiş (Orphaned) sayfalar.
  4. Veritabanları: Hükümetlerin ihale kayıtları veya üniversite kütüphaneleri.
Bir OSINT uzmanı için Deep Web araştırmacılığı; "Google'ın tıklayamadığı o butona tıklama" sanatıdır.

Bölüm 2: İndekslenmemiş Veriye Ulaşma Teknikleri​

Google'da bulamadığınızı nerede arayacaksınız? Cevap: Uzmanlaşmış Arama Motorları ve Veritabanları.

1. Akademik ve Bilimsel Araştırma​

Google Scholar iyidir ama yetersizdir.
  • arXiv.org: Fizik, matematik ve bilgisayar bilimleri alanındaki yayınlanmamış makaleler (Pre-print).
  • Core.ac.uk: Dünyadaki tüm açık erişimli araştırma makalelerini tarayan devasa bir motor.
  • WorldCat: "Dünyadaki tüm kütüphaneler tek bir yerde." Bir kitabın, tezin veya DVD'nin hangi kütüphanede olduğunu gösterir.

2. Şirket ve Finans İstihbaratı​

Bir şirketin web sitesindeki "Hakkımızda" yazısı reklamdır. Gerçekler ise resmi kayıtlardadır.
  • EDGAR (SEC.gov): ABD borsalarında işlem gören tüm şirketlerin (Apple, Tesla, vb.) en ince detayına kadar finansal raporları, risk analizleri ve yönetici maaşları buradadır. Google burayı tam indeksleyemez çünkü veriler PDF veya özel formatlardadır.
  • Opencorporates: Dünyanın en büyük açık şirket veritabanı. Bir şirketin paravan olup olmadığını veya hangi ülkelerde şubesi olduğunu buradan bulursunuz.
  • Türkiye için: Ticaret Sicil Gazetesi sorgulamaları (üyelik gerektirir ama halka açıktır), bir şirketin Deep Web verisidir.

3. Hukuki Kayıtlar ve Devlet Verileri​

  • Mahkeme Kayıtları: Çoğu ülkede dava dosyaları halka açıktır ancak Google'da çıkmaz. İlgili ülkenin adalet bakanlığı portalından (Örn: ABD için PACER, Türkiye için UYAP Vatandaş Portal -kendi davalarınız için-) sorgulama yapılması gerekir.
  • Patent Ofisleri: Bir şirketin ne üzerine çalıştığını web sitesinden önce patent başvurularından öğrenirsiniz. (Google Patents veya WIPO veritabanı).

Bölüm 3: Gri Edebiyat (Grey Literature)​

Yayınlanmamış, ticari olmayan ama teknik değeri çok yüksek belgelere "Gri Edebiyat" denir.
  • Türleri: Teknik raporlar, çalışma kağıtları (whitepapers), konferans sunumları, devlet istatistikleri.
  • Nasıl Bulunur?
    • filetype:pdf veya filetype:ppt gibi Google Dork'ları ile "sitenin arka bahçesindeki" sunum dosyalarını arayarak.
    • SlideShare veya Scribd gibi döküman paylaşım sitelerinin derinliklerinde arama yaparak.
İstihbarat Değeri: Bir mühendisin konferansta yaptığı sunumda, şirketin henüz duyurmadığı bir ürünün şeması veya kullanılan yazılımın versiyon bilgisi bulunabilir.

Bölüm 4: Deep Web'in Zaman Makinesi​

Bazen aradığınız veri silinmiştir. Deep Web sadece "şu an"ı değil, "geçmişi" de kapsar.
  • Wayback Machine (Internet Archive): Bir web sitesinin 10 yıl önceki halini görmek, silinen bir "Yönetim Kurulu" sayfasını incelemek veya değiştirilen bir basın bültenini bulmak için eşsizdir.
  • Google Cache: Bir sayfa kapanmış olsa bile, Google'ın önbelleğinde (cache) hala duruyor olabilir. (Arama sonucunun yanındaki üç noktaya tıklayıp "Önbellek" diyerek erişilir).

Bölüm 5: Dizinler ve Portallar (Directories)​

Eskiden Google yokken "Dizinler" vardı. Deep Web araştırmasında bu yöntem hala geçerlidir. Aradığınız şeyi (Keyword) değil, aradığınız şeyin olabileceği yeri (Directory) ararsınız.
  • Örnek: "Ahmet Yılmaz'ın telefon numarası" diye aramak yerine; "Türkiye telefon rehberi veritabanı" diye arayıp, o veritabanının içine girip sorgu yaparsınız.
  • Araç: Carrot2. Bu araç, arama sonuçlarını kümeler (clustering) halinde sunar. Size "Elma" ile ilgili sonuçları; "Meyve", "Teknoloji Şirketi", "New York Şehri" gibi kategorilere ayırarak Deep Web içinde kaybolmanızı engeller.

Bölüm 6: Deep Web Araştırmasında Dikkat Edilmesi Gerekenler​

Deep Web araştırması sabır işidir.
  1. Doğru Anahtar Kelimeler: Veritabanları Google gibi "akıllı" değildir. "Bana araba resimleri bul" derseniz anlamaz. "Vehicle AND Photo NOT Truck" gibi "Boolean" operatörleri kullanmanız gerekir.
  2. Üyelik Engelleri: Çoğu Deep Web kaynağı ücretsizdir ancak üyelik ister. Araştırma için kullandığınız "Sock Puppet" (Sahte) e-posta adresleri burada devreye girer.
  3. Veri Doğrulama: Deep Web'de (özellikle forumlarda) bulunan bilgiler editoryal kontrolden geçmemiştir. Bilginin kaynağını (Source Reliability) mutlaka teyit etmelisiniz.

Sonuç: Tıklanmayan Linklerin Peşinde​

Deep Web araştırmacılığı, modern çağın kütüphaneciliğidir. Bir siber güvenlik analisti veya araştırmacı gazeteci için en kritik bilgiler, herkesin gördüğü manşetlerde değil; bir veritabanının 45. satırında veya 5 yıl önce arşivlenmiş bir PDF dosyasının dipnotunda saklıdır.

Yüzeyde herkes yüzebilir; ama hazine derindedir.
 
Geri
Üst