← Sözlük
Sözlük · Yapay Zekâ Modelleri

Transformer nedir, ne demek?

Transformer, dikkat mekanizmasını (Self-Attention) temel alarak sıralı verileri paralel olarak işleyen, günümüz büyük dil modellerinin ve üretken yapay zekânın temelini oluşturan derin öğrenme mimarisidir.

Etimoloji ve Ardışık Kısıtların Yıkılışı

Transformer mimarisi, 2017 yılında Google araştırmacılarının yayınladığı 'Attention Is All You Need' makalesiyle duyurulmuştur. Bu makaleden önce doğal dil işleme (NLP), verileri kelime kelime sırayla okuyan Yinelemeli Sinir Ağları (RNN) ve LSTM modellerine bağımlıydı.

Ancak RNN'lerin doğası gereği ardışık çalışması iki devasa kısıt yaratıyordu: Cümle uzadıkça baştaki bilgilerin unutulması (kaybolan gradyan problemi) ve donanım seviyesinde modern grafik işlemcilerin (GPU) sunduğu devasa paralel hesaplama gücünün kullanılamaması. Transformer mimarisi, yineleme (recurrence) mekanizmasını tamamen çöpe atarak tüm kelimeleri aynı anda paralel olarak işleyen ve aralarındaki anlamsal bağları 'Öz-Dikkat' (Self-Attention) ile kuran devrimsel bir paradigma getirmiştir.

Şöyle düşünün: Gürültülü bir kokteyl partisinde konuştuğunuz kişiyi dinlediğinizi hayal edin. Eski RNN mimarisi tüm sesleri eşit düzeyde ve sırayla kaydeder; konuşma uzadıkça sesler birbirine karışır ve ana tema kaybolur. İnsan beyni ve Transformer ise odadaki uğultuyu aynı anda duyar ancak yalnızca konuştuğu kişinin sesine ve kritik kelimelere dikkat kesilir. Transformer, cümledeki tüm kelimeleri aynı anda masaya yatırır ve kelimeler arasındaki anlam bağını saniyeler içinde hesaplar.

Teknik Derinlik ve Matematiksel Blok Mimarisi

- Ölçeklenmiş Nokta Çarpım Dikkati (Scaled Dot-Product Attention): Girdi matrisleri Query, Key ve Value tensörlerine dönüştürülür; benzerlik matrisi softmax fonksiyonundan geçirilerek ağırlıklandırılır.
- Çok Başlı Dikkat (Multi-Head Attention): Model aynı anda dilbilgisi, mantık ve zamir eşleştirmesi gibi farklı anlamsal uzaylarda birden fazla dikkat başı çalıştırır.
- Konumsal Kodlama (Positional Encoding): Veriler paralel girdiğinden kelime sıraları sinüzoidal dalgalar veya Döner Konumsal Gömmeler (RoPE) ile tensörlere eklenir.
- İleri Besleme ve Katman Normalizasyonu: Residual bağlantılar ve RMSNorm katmanları sayesinde yüzlerce katmanda dahi gradyan akışı kayıpsız korunur.
- Maskeli Dikkat ve Çıkarım Önbelleği (KV Cache): Decoder modellerinde gelecekteki tokenlar maskelenir; üretim esnasında hesaplanan matrisler KV Cache ile bellekte tutularak çıkarım hızlandırılır.

Sosyolojik Boyut: GPU Simyası ve Evrensel Zekâ Arayışı

Transformer mimarisi, yalnızca bilgisayar bilimlerinde bir algoritma yeniliği değil; donanım ile yazılımın tarihteki en kusursuz simyasıdır. GPU mimarisinin paralel tensör çarpım yetenekleri ile Transformer'ın paralel dikkat matematiği birbirini besleyerek milyarlarca dolarlık yapay zekâ sanayi devrimini başlatmıştır.

Bunun ötesinde Transformer, metin sınırlarını aşarak evrensel bir yapay zekâ omurgası haline gelmiştir. Görselleri piksel parçaları olarak işleyen Vision Transformer (ViT), ses sinyallerini işleyen Whisper ve biyolojide protein katlanmalarını çözen AlphaFold, gücünü aynı dikkat mekanizmasından alır. İnsanlığın karmaşık sistemleri anlama ve modelleme kapasitesi Transformer ile yeni bir bilişsel çağa girmiştir.

Sık Yapılan Hatalar ve Yanılgılar

- Kuadratik Karmaşıklığı (O(N^2)) Unutmak: Bağlam uzadıkça dikkat hesaplama maliyeti katlanarak büyür; FlashAttention gibi optimize çekirdekler kullanılmalıdır.
- Dikkat Ağırlıklarını Mantıksal Açıklama Sanmak: Yüksek dikkat skoru mutlak bir neden-sonuç kanıtı değil, istatistiksel bir ağırlık korelasyonudur.
- Yanlış Göreve Yanlış Model Seçmek: Salt sınıflandırma veya arama işlerinde devasa Decoder modelleri yerine Encoder modelleri tercih edilmelidir.

Sıkça Sorulanlar

Transformer mimarisinin RNN ve LSTM modellerine göre en büyük üstünlüğü nedir?

Verileri tek tek sırayla okumak yerine cümlenin tamamını aynı anda paralel işleyebilmesi, böylece uzun mesafeli anlamsal bağları unutmaması ve GPU donanımlarında çok yüksek hızda eğitilebilmesidir.

Query, Key ve Value (Q, K, V) kavramları ne işe yarar?

Arama motoru mantığına benzer: Query aranan sorguyu, Key doküman başlıklarını/etiketlerini, Value ise dokümanın asıl içeriğini temsil eder; Query ile Key eşleştiğinde Value ağırlıklandırılarak çekilir.

FlashAttention nedir ve Transformer modellerine nasıl hız kazandırır?

GPU'nun yavaş genel belleği (HBM) ile hızlı yazmaçları (SRAM) arasındaki bellek transferlerini optimize ederek kuadratik dikkat hesaplamasını donanım seviyesinde hızlandıran ve VRAM tüketimini düşüren bir algoritmadır.

Transformer modelleri yalnızca metin işlemek için mi kullanılır?

Hayır; günümüzde görüntüler (Vision Transformer), ses dosyaları (Whisper), video üretimi (Sora) ve hatta biyolojide protein yapıları (AlphaFold) Transformer mimarisiyle işlenmektedir.

İlgili terimler

İlgili araçlar

Bu açıklama TreScout için sade dille hazırlandı · yanlış ya da eksik gördüğünüz bir şey olursa hello@trescout.com. TreScout her gün GitHub, Hacker News ve HuggingFace trendlerini Türkçe özetler.