💡 3 Maddede Bu Yazının Özeti
Kısa özet: Google DeepMind, 30 Temmuz 2026’da Gemini Robotics 2 ailesini tanıttı. Yenilik yalnız daha iyi nesne tanıma değil: sistem, çevreyi yorumlayan ve uzun görevleri planlayan Gemini Robotics ER 2 ile planı motor komutlarına dönüştüren VLA modellerini ayırıyor. ER 2…
Kısa özet: Google DeepMind, 30 Temmuz 2026’da Gemini Robotics 2 ailesini tanıttı. Yenilik yalnız daha iyi nesne tanıma değil: sistem, çevreyi yorumlayan ve uzun görevleri planlayan Gemini Robotics ER 2 ile planı motor komutlarına dönüştüren VLA modellerini ayırıyor. ER 2 bugün Google AI Studio ve Gemini API’de önizleme olarak denenebiliyor; tam robot kontrol modeli Gemini Robotics 2 ile cihazda çalışan sürüm ise yalnız seçilmiş testçilere açık. Bu nedenle evdeki bir robota indirip kurabileceğiniz hazır bir paket değil. En somut kullanım alanı, görüntü veya videodan nesne konumu, görev ilerlemesi ve yapılandırılmış eylem planı çıkarıp bunu güvenlik katmanları olan bir robot yazılımına bağlamak.
Yenilik: Robotun “beyni” ile motor kontrolü ayrılıyor
Gemini Robotics 2 ailesinde üç model var. Gemini Robotics ER 2, metin, görüntü, video ve sesi yorumlayan üst düzey akıl yürütme katmanı. Bir ortamda hangi nesnelerin bulunduğunu, aralarındaki uzamsal ilişkiyi ve çok adımlı bir görevin nasıl bölüneceğini çıkarıyor. Standart ve düşük gecikmeli akış için iki API uç noktası bulunuyor.
Gemini Robotics 2 adlı vision-language-action (VLA) modeli, görsel ve dil girdisini robot hareketine dönüştürüyor. DeepMind; iki kollu sistemlerden 22 serbestlik dereceli ellere ve tam humanoid gövdeye kadar uyarlanabildiğini, denge merkezini gözeterek adım atma, eğilme ve uzanma gibi hareketleri kontrol edebildiğini söylüyor. Gemini Robotics On-Device 2 ise ağ gecikmesinin veya bağlantının sorun olduğu durumlar için robot üzerinde çalışacak hafif sürüm.
Buradaki kritik sınır erişim. ER 2, geliştiricilerin bugün deneyebileceği bir görsel-dil modeli; çıktısı metin veya yapılandırılmış koordinatlar. VLA ve cihaz içi model ise genel indirilebilir ağırlıklar değil. Lisansları da açık kaynak lisansı olarak yayımlanmış değil; DeepMind bunları özel önizleme ve güvenilir testçi programıyla dağıtıyor.
Nasıl çalışıyor?
Pratik akış dört katmanlı düşünülebilir. Kamera ve mikrofon çevre verisini toplar. ER 2 sahneyi yorumlar; örneğin bir raftaki kutuyu koordinatlarıyla bulur, engelleri işaretler ve “kutuyu al, taşıma arabasına bırak” görevini adımlara böler. Bir VLA veya kurumun kendi robot denetleyicisi bu adımları hareketlere çevirir. En alttaki çarpışma önleme, kuvvet sınırı, denge ve acil durdurma mekanizmaları ise modelden bağımsız çalışır.
Standart gemini-robotics-er-2-preview uç noktası 131.072 giriş ve 65.536 çıkış belirteci destekliyor. Kod çalıştırma, işlev çağırma, yapılandırılmış çıktı, URL bağlamı ve Google Search ile temellendirme mevcut. gemini-robotics-er-2-streaming-preview ise Live API üzerinden sürekli ses ve video akışına, metin çıktısına ve düşük gecikmeli işlev çağrılarına odaklanıyor; standart uç noktadaki kod çalıştırma ve yapılandırılmış çıktı gibi bazı yetenekleri taşımıyor.
DeepMind’in resmî videoları tam gövde kontrolü, ampul takma ve düğüm bağlama gibi hassas hareketler ile iki robotun ortak görev bölüşmesini gösteriyor. Bunlar etkileyici demolar, fakat bağımsız saha testi değil. Şirket ayrıntılı karşılaştırmalarda kendi değerlendirmelerine dayanıyor; farklı robot markaları, aydınlatma, kamera açısı ve gerçek iş yeri karmaşası aynı başarıyı garanti etmiyor.
Kimler için önemli?
Robotik geliştiricileri, görüntüden nesne noktası veya sınırlayıcı kutu çıkarma, video içinde görev ilerlemesini izleme ve robot işlevlerini doğal dille sıralama için ER 2’yi kullanabilir. Depo ve üretim ekipleri, tek modele tüm yetkiyi vermeden görsel kontrol, parça bulma veya iki robot arasında iş bölümü prototipleri geliştirebilir. Erişilebilirlik ekipleri için sesli doğal dil komutları, hareket kısıtlılığı olan kullanıcıların yardımcı robotlarla daha kolay etkileşmesini sağlayabilir.
Fakat bu bir tüketici ürünü değil. Evinde robotu olmayan bir kullanıcı için en erişilebilir deneme, AI Studio’da bir masa veya raf fotoğrafı yükleyip nesnelerin koordinatlarını istemek. Gerçek robot entegrasyonu kamera, denetleyici, güvenli çalışma alanı ve donanıma özgü yazılım gerektiriyor. Google’ın 100’den fazla güvenilir testçiyle çalıştığını söylemesi geniş genel erişim anlamına gelmiyor.
Gerçek kullanım: Depoda yanlış kutuyu alma riskini azaltmak
Bir depo senaryosunda operatör, “Mavi etiketli küçük kutuyu üst raftan al ve A arabasına bırak” diyebilir. ER 2 kamera görüntüsünde hedef kutuyu, rafı ve arabayı belirler; görevi bulma, yaklaşma, kavrama ve bırakma adımlarına böler. Her adım, yalnız izinli robot işlevleriyle temsil edilir. VLA veya hareket planlayıcı motor komutunu üretir; kuvvet sensörü ve güvenlik PLC’si ise hız, yük ve insan yakınlığı sınırlarını uygular.
Doğru tasarımda model “kutuyu gördüm” dedi diye robot hareket etmez. Koordinat güven aralığı, ikinci kamera doğrulaması ve insanın onayı gerekebilir. Barkod veya RFID gibi deterministik bir sinyal varsa görsel tahminle birlikte kullanılmalıdır. Video ilerleme özelliği, kutunun gerçekten kavrandığını ve arabaya bırakıldığını izleyebilir; başarısızlıkta yeniden denemek yerine güvenli duruma geçme kuralı tanımlanmalıdır.
AI Studio ve API ile ilk deneme
- Google AI Studio’da
gemini-robotics-er-2-previewmodelini seçin. - Kişisel veri içermeyen bir masa veya raf fotoğrafı yükleyin.
- En fazla 10 nesnenin adını ve 0-1000 aralığında
[y, x]koordinatını JSON olarak isteyin. - Çıktıyı görsel üzerinde işaretleyip gerçekten nesnenin üzerine düşüp düşmediğini kontrol edin. Küçük nesnelerde resmi kırpıp yeniden deneyin.
- Robot bağlamadan önce aynı istemi farklı ışık ve açıdaki izinli görüntülerle tekrarlayın; hataları türlerine göre kaydedin.
Python istemcisiyle başlangıç için ayrı bir sanal ortam kullanmak yeterli:
test_dir="$(mktemp -d)"
uv venv --python 3.12 "$test_dir/.venv"
source "$test_dir/.venv/bin/activate"
uv pip install "google-genai==1.36.0"
export GEMINI_API_KEY="GIZLI_ANAHTARINIZ"
python nesne_noktalari.py
Biz temiz bir Python 3.12 ortamında google-genai==1.36.0 paketini ve 23 bağımlılığını kurduk; içe aktarma ile uv pip check başarılı oldu. API anahtarı ve robot donanımı bulunmadığı için ER 2 çağrısı, canlı video akışı ve fiziksel hareket test edilmedi. API anahtarını koda veya komut geçmişine yazmayın; Google ayrıca kısıtlanmamış anahtarla yapılan Robotics API çağrılarının 403 döneceğini belirtiyor.
Maliyet, veri ve bölgesel erişim
Standart ER 2’nin ücretli API fiyatı bir milyon giriş belirteci için 2 dolar, düşünme belirteçleri dahil çıkış için 10 dolar. Toplu işleme fiyatları sırasıyla 1 ve 5 dolar. Önbelleğe alma bir milyon belirteç için 0,20 dolar, saklama ise saat başına 1 dolar olarak listeleniyor. Görüntü ve özellikle video, metinden daha fazla belirteç ve işlem süresi tüketebilir; gerçek maliyet çözünürlük, süre, tekrar ve düşünme düzeyiyle artar.
Ücretsiz katmanda fiyat sıfır olsa da fiyat sayfası girdilerin Google ürünlerini geliştirmek için kullanılabileceğini söylüyor; ücretli katmanda bu alan “hayır”. Robot kameraları yüz, ses ve iş yeri görüntüsü toplayabileceği için bu önemli bir gizlilik ayrımı. Google’ın Robotics gizlilik bildirimi, çevredeki tanınabilir kişilerin bilgilendirilmesini ve onayını, veri toplamayı en aza indirmeyi ve mümkünse yüz bulanıklaştırmayı istiyor. Türkiye, Gemini API ve AI Studio’nun desteklenen ülkeleri arasında listeleniyor; yine de kurum hesabı, yaş ve hizmet koşulları erişimi etkileyebilir.
Sınırlamalar ve güvenlik
- Önizleme kararlılığı: Uç nokta ve davranışlar değişebilir. ER 1.6’nın Ağustos sonunda kapatılacak olması, sürüm sabitleme ve geçiş planının zorunlu olduğunu gösteriyor.
- Yanlış algı fiziksel sonuca dönüşebilir: Halüsinasyon, kötü ışık veya alışılmadık nesne konumu yanlış hedef seçimine yol açabilir.
- Güvenlik dereceli sistem değil: DeepMind, insan çalışma alanına girince durma davranışının araştırma özelliği olduğunu ve garantili güvenlik sistemi sayılmadığını açıkça belirtiyor.
- Kritik kullanım yasakları: Model kartı; sağlık, ulaşım veya arızanın ölüm, yaralanma ya da maddi hasar doğurabileceği güvenlik-kritik işlerde Robotics modellerinin kullanılmamasını istiyor.
- On-device eşittir açık değil: Yerel sürüm veri ve gecikme avantajı vaat ediyor, ancak ağırlıklar, donanım gereksinimi ve genel kullanım lisansı yayımlanmış değil.
Sonuç olarak Gemini Robotics 2, robotikte tek bir dev model yerine planlama, hareket ve donanım güvenliğini katmanlara ayıran daha uygulanabilir bir mimari sunuyor. Bugün çoğu geliştirici için gerçek ürün ER 2 API’si; humanoid videoları ise gelecek yönünü gösteren kontrollü demolar. Başarılı bir prototipin ölçütü robotun bir kez görevi yapması değil, belirsizlikte durması, kişisel veriyi koruması ve aynı işi farklı koşullarda güvenilir biçimde tekrar edebilmesi.
Kaynaklar
- Google DeepMind: Gemini Robotics 2 ürün sayfası — erişim: 2 Ağustos 2026.
- Gemini Robotics ER 2 model kartı — yayımlanma: 30 Temmuz 2026.
- Gemini API: Robotics ER 2 genel bakış, örnek ve gizlilik bildirimi.
- Gemini API fiyatlandırması: Robotics ER 2.
- Google DeepMind: robotik güvenlik çerçevesi.
- Google DeepMind YouTube: Intelligent whole-body control with Gemini Robotics 2 — 30 Temmuz 2026.
- Google DeepMind YouTube: Advanced dexterity with Gemini Robotics 2 — 30 Temmuz 2026.
Editoryal not: Resmî videoların tam konuşma metni kopyalanmadı. Yazı, video başlığı, açıklaması ve tarihi ile ürün sayfası, API belgeleri ve model kartından hazırlanmış özgün Türkçe analizdir.