Microsoft, yapay zeka alanındaki yeteneklerini geliştirmeye devam ediyor. Şirket, metin, ses ve görüntü üretimi yapabilen üç yeni modelini tanıttı. Bu modellerin isimleri MAI-Transcribe-1, MAI-Voice-1 ve MAI-Image-2 olarak belirlendi. Bu yenilikler, kullanıcıların dijital dünyada daha verimli çalışmasını sağlamayı amaçlıyor.
Özellikle metin dönüştürme alanında dikkat çeken MAI-Transcribe-1, Microsoft’un Azure Fast hizmetine göre tam 2,5 kat daha hızlı çalışıyor. Bu model, 25 dilde konuşmaları metne çevirebiliyor. Bununla birlikte, zorlu koşullarda bile işlevselliğini koruyarak arka plan gürültüsü, düşük kaliteli ses kayıtları ve üst üste binen konuşmalar gibi zorlukları aşabiliyor. Kafe, ofis ve konser gibi gerçek yaşam senaryolarında yapılan testlerle bu modelin pratikteki başarısı ortaya konulmuş durumda. Ayrıca, modelin sağladığı altyazı üretimi, podcast transkripsiyonu ve toplantı arşivleme gibi uygulamalar, kullanıcıların iş süreçlerini kolaylaştırıyor.
MAI-Transcribe-1, gerçek zamanlı toplantı transkripsiyonu ve dikte gibi çevrimiçi görevlerde de yüksek performans sergiliyor. Microsoft’un Copilot Sesli Modu ve Microsoft Teams ile entegrasyonu da kullanıcı deneyimini zenginleştirecek. Bu özellikler, iş dünyasında etkileşimi artırmaya yönelik önemli bir adım.
Yapay zeka alanındaki diğer bir yenilik olan MAI-Voice-1, kullanıcıların bir saniyede 60 saniyelik ses üretmesine olanak tanıyor. Bu model, özel sesler oluşturarak kişiye özel bir deneyim sunuyor. Ses tasarımı yapan profesyoneller için büyük bir yardımcı olacağı söyleniyor. Modelin sunduğu bu özellik, içerik üreticileri ve medya sektöründeki profesyoneller için yeni fırsatlar yaratacak.
Bir diğer dikkat çekici model ise MAI-Image-2. Bu model, fotogerçekçilik alanında önemli bir ilerleme kaydetti. Doğal ışık, doğru cilt tonları ve gerçekçi ortamlar sunarak kullanıcıların post-prodüksiyon sürecinde harcadıkları zamanı azaltmayı hedefliyor. Ayrıca, görsel içerik üretimi sırasında metin oluşturma yeteneği ile dikkat çekiyor. Poster, infografik, slayt ve diyagram gibi çeşitli içeriklerde tutarlı sonuçlar elde edilebiliyor.
MAI-Image-2 ilk olarak 19 Mart’ta MAI Playground adlı yeni büyük dil modeli test yazılımında tanıtıldı. Şimdi ise Microsoft Foundry üzerinden kullanıma sunuluyor. Bu durum, görsel içerik üreticileri için önemli bir gelişme olarak öne çıkıyor.
Fiyatlandırma açısından MAI-Transcribe-1 saat başına 0,36 dolardan başlarken, MAI-Voice-1 1 milyon karakter için 22 dolar olarak belirlenmiş. MAI-Image-2 ise metin girdisi için 1 milyon token başına 5 dolar, görüntü çıktısı için ise 1 milyon token başına 33 dolardan hizmet verecek. Bu fiyatlar, yapay zeka çözümlerinin erişilebilirliğini artırma yönünde önemli bir adım.
Microsoft’un yapay zeka araştırma ekibi MAI Superintelligence, CEO Mustafa Suleyman liderliğinde bu modelleri geliştirdi. Süleyman, Microsoft’un OpenAI ile olan işbirliğine de bağlı kalmaya devam ettiğini belirtti. Bu ortaklık, gelecekteki yapay zeka projeleri için yeni olanaklar yaratabilir.
Sonuç olarak, Microsoft’un yeni yapay zeka modelleri, hem hız hem de performans açısından büyük bir yenilik sunuyor. Teknolojinin bu alandaki gelişmeleri, iş dünyasında ve günlük yaşamda önemli değişimlere yol açacak gibi görünüyor.