💡 3 Maddede Bu Yazının Özeti
GPT-5.6 Sol, Model ML finans testlerinde PowerPoint ve Excel üretimini nasıl değiştirdi? Güçlü sonuçlar, sınırlamalar ve insan denetimi.
Finans ekiplerinde yapay zekânın gerçek sınavı, bir soruya iyi cevap vermek değil; araştırmayı kaynakları izlenebilir, formülleri çalışan ve yöneticinin inceleyebileceği bir PowerPoint ya da Excel dosyasına dönüştürmektir. OpenAI’nin 10 Ağustos 2026’da yayımladığı Model ML videosu ve vaka çalışması, GPT-5.6 Sol’un bu “son kilometre” işinde daha az yönlendirmeyle daha kullanışlı çıktılar üretebildiğini savunuyor.
Sonuçlar dikkat çekici: GPT-5.6 Sol, Model ML testlerinde PowerPoint dosyalarının tamamını üretebildi; profesyonel incelemeye hazır sunum oranında Opus 5’e 16,6 puan fark attı ve Fable 5’ten sunum başına yüzde 21 daha az belirteç kullandı. Ancak tablo bütünüyle tek taraflı değil. Excel’de bütün önemli sonuçları eksiksiz doğru olan çalışma oranı yüzde 50’de kaldı; Opus 5, Fable 5 ve GPT-5.5 yüzde 60’a ulaştı. Kısacası video, “finansçının yerini alan kusursuz ajanı” değil, insan incelemesine daha yakın bir ilk taslak üreten sistemi gösteriyor.
Videonun ana fikri: AI çıktısı ile gerçek iş arasındaki mesafe
Model ML kurucu ortağı ve CEO’su Chaz Englander videoya, düşük kaliteli yapay zekâ içeriği ile gerçek iş arasında büyük bir fark bulunduğunu söyleyerek başlıyor. Finans için bu fark yalnızca metnin akıcı olmasıyla ölçülmüyor. Bir yatırım komitesi notunda sayıların doğru kaynağa bağlanması, hesapların yeniden çalıştırılabilmesi, grafiklerin düzenlenebilir olması ve sunumun kurum şablonuna uyması gerekiyor.
Model ML’nin yaklaşımı, tek bir sohbet yanıtı üretmek yerine görevi baştan sona taşıyan ajanlar kurmak. Kullanıcı kısa bir görev tanımı ve kaynakların yönünü veriyor. Ana ajan işi planlıyor, uygun araçları seçiyor, kanıtları uzlaştırıyor, hesaplamaları yapıyor ve adımları göreve en uygun modele yönlendiriyor. Belge araçları daha sonra yerel PowerPoint ve Excel öğeleri oluşturuyor; yani grafikler düz bir ekran görüntüsü olarak değil, sonradan değiştirilebilen nesneler olarak teslim ediliyor.
Bir yatırım komitesi sunumu nasıl oluşturuluyor?
Videodaki örnek bir yatırım komitesi, yani IC sunumu. Ajan önce slaytların hangi sırayla ilerleyeceğini ve nasıl görünmesi gerektiğini planlıyor. Ardından araştırmayı yürütüyor, hesaplamaları yapıyor, grafik, tablo ve logoları yerleştiriyor. Son aşamada her slaydı görsel açıdan yeniden inceliyor ve kullanıcıya kaynakları izlenebilir, düzenlenebilir bir PowerPoint dosyası veriyor.
Buradaki esas kazanım, uzmanın karar verme rolüne daha fazla zaman ayırabilmesi. Uzmanın hâlâ varsayımları sınaması, anlatıyı keskinleştirmesi ve sonuçların iş bağlamına uyup uymadığını değerlendirmesi gerekiyor. Otomasyonun hedefi bu yargıyı ortadan kaldırmak değil; veri toplama, biçimlendirme ve yeniden kurma yükünü azaltmak.
PowerPoint sonuçları ne söylüyor?
Model ML’nin Composite değerlendirmesi, gerçek finans görevlerinden yüzlerce sunumu ayrıntılı bir puanlama anahtarıyla inceliyor. GPT-5.6 Sol testlerin yüzde 100’ünde bir .pptx dosyası üretti. Bu oran Opus 5’te yüzde 76, Fable 5’te yüzde 82 ve GPT-5.5’te yüzde 74 oldu.
- Profesyonel incelemeye hazır çıktı: GPT-5.6 Sol yüzde 43,3; Opus 5 yüzde 26,7; Fable 5 yüzde 32.
- Sunum başına belirteç: Sol 1,10 milyon; Fable 5 1,40 milyon. Buradan videodaki yüzde 21 daha az belirteç sonucu çıkıyor.
- Tasarım tutarlılığı: Sol yüzde 97,8 ile karşılaştırmadaki en yüksek değere ulaşıyor.
- Görsel kalite: Sol yüzde 77,9; Opus 5 yüzde 79,3. Yani Sol her görsel ölçütte lider değil.
- Grafik okunabilirliği: Sol yüzde 78,8; Opus 5 yüzde 83,1 ve Fable 5 yüzde 79,7.
Bu ayrım önemli. “Daha fazla dosya tamamladı” ve “incelemeye daha hazır çıktı verdi” ifadeleri, “her slaytta en iyi görsel kaliteyi sağladı” anlamına gelmiyor. Sol’un avantajı, kalite, tamamlanma oranı ve düzenlenebilir teslimatın birlikte değerlendirilmesinde ortaya çıkıyor.
Excel tarafında hız ve doğruluk birlikte okunmalı
Excel testinde GPT-5.6 Sol, çalışma kitabı başına 2,44 milyon belirteç kullandı. Opus 5’in 3,83 milyon belirtecine göre yaklaşık yüzde 36 daha verimliydi ve işi ortalama yedi dakikada bitirdi. Beklenen çıktıların bulunması ve dosyanın yapısal sözleşmeyi karşılaması yüzde 100 oldu.
Buna karşılık “bütün temel çıktıları doğru” çalışma kitabı oranı Sol’da yüzde 50’ydi. Opus 5, Fable 5 ve GPT-5.5 yüzde 60’a ulaştı. Temel çıktıların tek tek doğruluk oranında Sol yüzde 83,3 ile güçlü görünse de bu, her çalışma kitabının tamamen doğru olduğu anlamına gelmiyor. Finans gibi hatanın maliyetli olduğu bir alanda formül denetimi, çapraz kontrol ve insan onayı zorunlu olmaya devam ediyor.
Beş dakikalık özel rapor ne kadar anlamlı?
OpenAI vaka çalışmasına göre küresel bir varlık yöneticisinde yaklaşık bir saat süren özel bir “tearsheet” hazırlığı beş dakikaya indi. Başka bir iş akışında ajanlar, 100 binden fazla satır ve yüzlerce dosya içeren sanal veri odalarını tek geçişte işledi.
Bunlar etkileyici üretim örnekleri, fakat bağımsız ve genellenebilir bir sektör ölçümü değiller. Sonuçlar Model ML’nin kendi ajan altyapısına, belge araçlarına, veri bağlantılarına, şablonlarına ve değerlendirme yöntemine bağlı. Aynı modelin çıplak bir sohbet arayüzünde aynı sonucu vereceği varsayılamaz. Başarı, model kadar onu çevreleyen araç sistemi ve kalite kapılarıyla ilgili.
Finans ekipleri için uygulanabilir kontrol listesi
- Görevi ve kabul ölçütlerini yazın: Hangi tablo, grafik, dönem ve kaynakların zorunlu olduğunu baştan belirtin.
- Kaynak izini koruyun: Her sayı belge, sayfa ve mümkünse ilgili pasajla eşleştirilebilmeli.
- Formülleri yeniden hesaplatın: Sadece görünen sonuca değil, hücre bağımlılıklarına ve hata durumlarına bakın.
- Sunumu düzenlenebilir teslim alın: Düzleştirilmiş görseller yerine yerel grafik, tablo ve metin nesnelerini tercih edin.
- İnsan onay kapısı koyun: Yatırım kararı, müşteri paylaşımı veya resmî raporlama öncesinde yetkili uzman incelemesi zorunlu olsun.
- Kendi iş akışınızı ölçün: Genel benchmark yerine kurumunuzun şablonları, veri kaynakları ve hata maliyetleriyle bir test kümesi oluşturun.
GPT-5.6 Sol finansçının yerini mi alıyor?
Hayır; paylaşılan kanıtlar bunu göstermiyor. Sistem araştırma, hesaplama ve belge üretiminin önemli kısmını otomatikleştirerek analisti daha nitelikli inceleme noktasına taşıyor. Buna rağmen sunumların yalnız yüzde 43,3’ünün profesyonel inceleme kapısını geçmesi ve Excel dosyalarının yarısında bütün temel sonuçların eksiksiz doğru olması, insan denetiminin hâlâ işin merkezinde olduğunu gösteriyor.
Sonuç: Kazanç daha iyi sohbet değil, daha kısa son kilometre
Model ML örneğinin en değerli tarafı, yapay zekâ verimliliğini yalnızca cevap süresiyle ölçmemesi. Düzenlenebilir dosya, çalışan formül, izlenebilir kaynak, görsel tutarlılık ve incelemeye hazır olma gibi gerçek teslimat ölçütlerini birlikte ele alıyor. GPT-5.6 Sol bu sistem içinde özellikle PowerPoint tamamlanma ve incelemeye hazırlık oranlarında güçlü bir ilerleme sunuyor.
Yine de en doğru okuma temkinli: Model ML ve OpenAI tarafından paylaşılan şirket içi değerlendirmeler, belirli bir ürün altyapısındaki sonucu gösteriyor. Finans ekipleri modeli ancak kendi veri kaynakları, şablonları, güvenlik kuralları ve insan onay süreçleri içinde sınadıktan sonra üretim kararı vermeli.
Kaynaklar
- OpenAI — How Model ML Uses GPT-5.6 Sol to Get Finance Work Done More Efficiently (10 Ağustos 2026)
- OpenAI — Model ML completes finance work more efficiently with GPT-5.6 Sol (10 Ağustos 2026)
- OpenAI — GPT-5.6 ürün duyurusu (9 Temmuz 2026)
- Model ML — resmî ürün sitesi
- Model ML — PowerPoint dışa aktarma yaklaşımı
Editoryal not: Bu yazı videonun birebir çevirisi değildir. Resmî video açıklaması ve otomatik konuşma metni, OpenAI’nin ayrıntılı vaka çalışması ve Model ML’nin ürün bilgileri karşılaştırılarak hazırlanmış özgün Türkçe özet ve analizdir. Benchmark sonuçları şirketlerin kendi değerlendirmeleridir; bağımsız sektör kanıtı olarak sunulmamıştır.