OpenAI, ön eğitim, pekiştirmeli öğrenme ve hizalama alanlarında yıllara yayılan çalışmaların sonucu olarak geliştirdiği GPT-6 Astra’yı tanıttı. Şirket tarafından bugüne kadarki en zeki ve en uyumlu model olarak tanımlanan Astra; bilgisayar kullanımı, internette gezinme, yazılım mühendisliği, siber güvenlik, bilim, matematik ve profesyonel iş akışlarında önemli ilerlemeler sunuyor.

Astra’nın karmaşık ve çok aşamalı görevleri daha yüksek hız, doğruluk ve muhakeme yeteneğiyle yerine getirmek üzere geliştirildiği belirtildi. OpenAI ayrıca modelin matematikte uzun süredir çözülemeyen açık problemlerin çözümüne katkıda bulunduğunu açıkladı.

Zorlu testlerde yüksek sonuçlara ulaştı

OpenAI’nin paylaştığı verilere göre GPT-6 Astra, FrontierMath Tier 4 değerlendirmesinde yüzde 98, ARC-AGI-3’te yüzde 99,9 ve ExploitBench’te yüzde 100 başarı elde etti.

Modelin matematik ve bilim alanlarındaki performansının yanı sıra bilgisayar kullanımı ve siber güvenlik testlerinde de önceki modele göre belirgin ilerleme gösterdiği ifade edildi.

İlk aşamada sınırlı erişim sağlanacak

GPT-6 Astra ilk olarak sınırlı sayıda kuruluşa sunuluyor. Modelin önümüzdeki günlerde ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarına açılması planlanıyor.

Astra ayrıca OpenAI API, Microsoft Azure ve AWS Bedrock üzerinden de erişilebilir olacak. Pro, Business ve Enterprise kullanıcılarının GPT-6 Astra Pro sürümüne de erişebileceği belirtildi. Kurumsal çalışma alanlarında ise yöneticiler modeli ayrıca etkinleştirecek ve erişim başlangıçta varsayılan olarak kapalı olacak.

Görev sınırlarını korumaya daha fazla odaklanıyor

OpenAI, Astra’nın kullanıcı niyetini anlama ve verilen yetki sınırlarının dışına çıkmama konusunda da geliştirildiğini açıkladı. Şirketin değerlendirmelerinde, üretim güvenliği önlemleri bulunmadığında GPT-5.6 Sol vakaların yüzde 48’inde yetkili hedefin dışına çıkarken, GPT-6 Astra’nın hiçbir değerlendirmede bu sınırı aşmadığı belirtildi.

Model, eksik bilgilerin sonucu önemli ölçüde değiştirmediği durumlarda bağlamdan yararlanabiliyor. Kritik bilginin eksik olması halinde ise kullanıcıya daha odaklı sorular yöneltebiliyor. Astra’nın görev sırasında yeni talimatlar verilse bile başlangıçtaki amacı ve önceki kısıtlamaları koruyabildiği ifade edildi.

Bilgisayar kullanımında hız ve performans arttı

OpenAI, GPT-6 Astra’yı çevrimiçi formlar, müşteri kayıtları, takvimler, araştırma, belge hazırlama ve yazılım testleri gibi çok sayıda görevde kullanılabilecek güçlü bir bilgisayar kullanım modeli olarak konumlandırıyor.

Astra çevrimiçi araştırma yapabiliyor, e-posta ve belgelerde özet hazırlayabiliyor, bilimsel verileri analiz edebiliyor, grafik oluşturabiliyor, web siteleri hazırlayabiliyor ve yazılımları bağımsız şekilde kurup test edebiliyor.

OSWorld 2.0 gecikme simülasyonlarında Astra, görev başına yaklaşık 40 dakikada yüzde 72,6 performans puanına ulaştı. GPT-5.6 Sol ise yaklaşık 75 dakikada yüzde 65,7 puan aldı. OpenAI, bunun görev başına yaklaşık yüzde 47 daha az süre anlamına geldiğini bildirdi.

Codex altyapısında yapılan donanım güncellemeleriyle birlikte Mind2Web değerlendirmesinde mevcut GPT-5.6 Sol deneyimine göre 1,9 kat daha hızlı görev tamamlama oranına ulaşıldığı da açıklandı.

Profesyonel iş akışlarına yönelik geliştirildi

GPT-6 Astra, çok aşamalı iş akışlarının yanı sıra belge, elektronik tablo, analiz ve sunum oluşturmak için de geliştirildi. Model mevcut şablonları takip edebiliyor, kullanıcının yazım ve görsel stiline uygun içerikler hazırlayabiliyor. OpenAI, Astra’nın uzun bağlam içerisindeki tüm bilgileri tekrar etmek yerine yalnızca sonuç açısından gerekli olan bölümleri kullanacak şekilde eğitildiğini belirtti.

ChatGPT’deki Sites özelliğiyle birlikte web siteleri, web uygulamaları ve oyunların doğrudan komutla oluşturulması, barındırılması ve paylaşılması da mümkün olacak. Codex tarafında ise uzun çalışma oturumlarında önceki bağlamın aranabilir kalmasını sağlayan yeni bir sistem geliştirildi. Deneysel özellik, daha sonra Astra için varsayılan hale getirilmeden önce config.toml üzerinden etkinleştirilebilecek.

Bilim ve matematikte yeni çalışmalar yapabiliyor

OpenAI, Astra’nın bilim, matematik ve sağlık alanlarında da önemli ilerlemeler sunduğunu belirtti. Şirket, asal sayılar arasındaki boşluklarla ilgili iki ek sonuç paylaştı ve modelin matematik ile bilim değerlendirmelerinde yeni rekorlara ulaştığını açıkladı.

Astra, yalnızca teorik problem çözmekle kalmayıp bilimsel verileri incelemek amacıyla özel yazılımları da çalıştırabiliyor. Böylece araştırmacıların kanıtları değerlendirmesine ve sonraki araştırma adımlarını belirlemesine yardımcı olabilecek şekilde kullanılabiliyor.

Siber güvenlikte Kritik eşiğe ulaştı

Astra’nın en dikkat çeken gelişmelerinden biri siber güvenlik alanında oldu. OpenAI, modelin Hazırlık Çerçevesi kapsamında siber güvenlikte Kritik eşiği karşıladığını açıkladı. Üretim güvenliği önlemleri olmadan yapılan ExploitBench testinde Astra yüzde 100, GPT-5.6 Sol ise yüzde 78,5 başarı elde etti. ExploitGym’de Astra yüzde 42,4, GPT-5.6 Sol ise yüzde 30,3 seviyesinde kaldı.

OpenAI’nin son üç aya ait güvenlik açıklarını kullanarak gerçekleştirdiği iç değerlendirmede Astra’nın daha önce bilinmeyen iki sıfır gün güvenlik açığını keşfettiği ve kullandığı belirtildi. Şirket bu açıkları geliştiricilere bildireceğini açıkladı.

Ham kaynak koduna erişmeden yazılım ikili dosyalarını tersine mühendislik yoluyla çözmeyi ölçen SRE-Bench testinde Astra ilk denemede yüzde 88, dört denemede yüzde 99,2 başarıya ulaştı. GPT-5.6 Sol ise sırasıyla yüzde 55,9 ve yüzde 68,7 oranlarında kaldı.

Siber yetenekler nedeniyle ek güvenlik kontrolleri getirildi

OpenAI, Astra’nın artan siber güvenlik kapasitesinin daha güçlü koruma önlemlerini gerekli hale getirdiğini belirtti.

Kullanıma sunulan sürüm güvenli kod incelemesi ve yama uygulama gibi savunma amaçlı görevleri destekleyecek. Buna karşılık güvenlik açıklarına yönelik kavram kanıtı saldırılarının oluşturulması gibi daha gelişmiş talepler reddedilecek.

Şirket, OpenAI Daybreak üzerinden ilerleyen haftalarda güvenlik açığı doğrulaması, kötü amaçlı yazılım analizi ve tespit mühendisliği gibi ek savunma iş akışları için erişimi genişletmeyi planlıyor.

Yetkisiz davranışlar izlenecek

Astra için jailbreak girişimlerine karşı dayanıklılığın artırıldığı, izleme sistemlerine daha fazla bağlam sağlandığı ve modelin kötü davranışları tetiklemek amacıyla hazırlanan bilgisayar kullanım testlerinde önceki modellere göre daha başarılı sonuç verdiği belirtildi.

OpenAI ayrıca Astra sınıfı modeller için üretim ortamında hizalama hatalarını takip eden bir sistem devreye alıyor. Sistem, modelin akıl yürütme ve eylemlerini inceleyerek potansiyel yetkisiz davranışları tespit edecek ve gerektiğinde işlemi otomatik olarak durdurabilecek.

Şirket, Astra’nın kendi yetenekleri hakkında yanlış beyanda bulunma olasılığının GPT-5.6 Sol’a göre üç kat daha düşük olduğunu da açıkladı.

Bununla birlikte bazı değerlendirmelerde Astra’nın yazılı muhakemesinin GPT-5.6 Sol’a göre daha zor izlenebilir olduğu tespit edildi. OpenAI, bu durumu ciddi bir araştırma konusu olarak değerlendirdiğini ve izlenebilirliği geliştirmeye yönelik çalışmaların süreceğini belirtti.

Kaynak: Haber Merkezi