Gelecekte büyük bir etki yaratacak bilimsel bir makaleyi ya da yazılım projesini, henüz kimse fark etmeden tespit etmek mümkün mü? Cornell Üniversitesi araştırmacılarına göre yanıt evet. Üstelik bunun anahtarı "indirme ve etkileşim" verilerinde saklı.
Araştırma ekibi, akademinin önde gelen makale deposu arXiv ve yazılımcıların ana üssü GitHub’dan topladıkları devasa veri setlerini yayınladı. Yöntemin temelinde ise "öncü-artçı tahmini" (lead-lag forecasting) adı verilen bir yaklaşım yatıyor. Bu yöntem; bir içeriğin yayınlandığı ilk günlerde aldığı görüntüleme, indirme ve beğeni gibi erken etkileşimleri analiz ederek, yıllar sonra ulaşacağı popülariteyi öngörüyor.
İçerikten Görseller
Sistem nasıl çalışıyor?

Geleneksel yöntemde bilimsel bir çalışmanın değeri, aldığı alıntı sayısıyla ölçülür ancak atıfların birikmesi yıllar alabilir. Cornell ekibi ise beklemek yerine, çalışmanın yayınlandığı ilk andaki okuma hızına odaklandı. Araştırmacılardan Yian Yin bu durumu bir "tahmin pazarına" benzetiyor. Bilim insanları para yerine değerli olan zamanlarını yatırarak içeriklerin geleceğini belirliyor.
2,3 milyon arXiv makalesinin anonim indirme verileri incelendiğinde, yalnızca 1 aylık indirme trafiğinin bir makalenin 5 yıl sonraki popülerliğini yüksek isabetle tahmin ettiği görüldü. Yaklaşık 3 milyon GitHub deposundaki yıldızlama, kod gönderme ve fork verileri incelendiğinde de aynı kuralın geçerli olduğu kanıtlandı. İlk dönemde gelen yıldızlar, 5 yıl sonraki kullanım oranının doğrudan habercisi oldu.
Geliştirilen bu yöntemin sadece popüler projeleri tespit etmekle kalmayıp, arXiv gibi platformları işgal eden düşük kaliteli veya yapay zekâyla üretilmiş değersiz içerikleri henüz başında tespit edip filtrelemek için de kullanılabileceği belirtiliyor. Öyle görünüyor ki önümüzdeki dönemde, sadece ne kadar üretildiğine değil, üretilen içeriğe ilk anda kimin ne kadar zaman ayırdığına bakarak geleceğin yönünü çok daha hızlı okuyabileceğiz.