Reklam
Vakıf Katılım
Tarih : 2026-08-04 17:32:03

Tether Data, VisionPsy-Nano yapay zeka modelini açık kaynak olarak yayımladı

Dijital varlık sektörünün en büyük şirketi olan Tether’in yapay zekâ araştırma girişimi QVAC, mobil cihazlar ve uç cihazlarda (edge) çalışmak üzere geliştirilen VisionPsy-Nano adlı görüntü ve dil modelini (Vision-Language Model - VLM) açık kaynak olarak yayımladığını duyurdu.

Yaklaşık 460 milyon parametreye sahip VisionPsy-Nano, daha önce bulut altyapısı gerektiren çok modlu (multimodal) yapay zekâ yeteneklerini doğrudan mobil cihazlara taşıyor. Model, 0,5 milyar parametrenin altındaki cihaz üzerinde çalışan görüntü ve dil modelleri arasında 62,3 normalize puanla kalite ve performans sıralamasında ilk sıraya yerleşti.

Kompakt yapısıyla sektör testlerinde öne çıktı

VisionPsy-Nano, yaklaşık 0,5 milyar parametre sınıfındaki modeller arasında yapılan karşılaştırmalarda Liquid AI ve Hugging Face tarafından geliştirilen rakip modelleri geride bıraktı. Yapılan testlerde VisionPsy-Nano-460M; Liquid AI’ın LFM2.5-VL-450M, Hugging Face’in SmolVLM2-500M ve temel modeli olan nanoVLM-460M-8k ile karşılaştırıldı. Model, 17 değerlendirme kriterinin 16’sında en yüksek performansı göstererek 62,3 normalize puana ulaştı.

Farklı kullanım ihtiyaçlarına yönelik iki sürüm sunuyor

Tether, VisionPsy-Nano’yu farklı kullanım senaryolarına uygun iki ayrı sürümle geliştiricilerin kullanımına sunuyor. VisionPsy-Nano-460M, kalite ve doğruluk odaklı yapısıyla standart görüntü ve dil testlerinde sınıfının en yüksek performansını sunuyor. VisionPsy-Nano-460M-Flash ise mobil cihazlarda çok daha düşük gecikmeyle çalışacak şekilde optimize edildi. Model, tam sürümün performansının yaklaşık yüzde 99’unu korurken, akıllı telefonlarda çok daha hızlı yanıt verebiliyor.

Mobil cihazlarda gelişmiş yapay zekâ deneyimi sunuyor

Kompakt yapısına rağmen VisionPsy-Nano birçok farklı alanda yüksek performans sergiliyor. Model; karmaşık belgelerden metin çıkarma (OCR), finansal raporlar ve infografikleri analiz etme, sahne algılama ve mekânsal analiz, görsel muhakeme ile komutları doğru yorumlama gibi görevlerde kendi kategorisindeki en başarılı sonuçlara ulaştı. Ayrıca MM-IFEval ve POPE gibi değerlendirme testlerinde, kendisinden 1,6 ila 2,3 kat daha büyük modelleri geride bırakarak dikkat çekici bir başarı elde etti.

Akıllı telefonlarda çok daha hızlı çalışıyor

VisionPsy-Nano-460M-Flash, daha az görsel veri işleyerek ilk yanıtı üretme süresini önemli ölçüde azaltıyor. Yapılan testlerde model; Pixel 9, Galaxy S23 ve Galaxy S25 Ultra cihazlarında SmolVLM2-500M ve temel modele kıyasla yaklaşık 19 ila 23 kat, iPhone 15'te ise 36 kata kadar daha hızlı ilk yanıt üretebildi. Aynı zamanda gecikme süresi bakımından LFM2.5-VL-450M ve Qwen3.5-0.8B modellerinden de daha iyi performans gösterdi.

Her iki model de Apache 2.0 lisansı altında açık ağırlık (open-weight) olarak yayımlandı. Araştırmacılar ve geliştiriciler; Hugging Face Transformers, llama.cpp tabanlı mobil çalıştırma altyapısı ve üretim ortamlarına yönelik vLLM desteği üzerinden modellere erişebilecek. Ayrıca tüm test yapılandırmaları ve değerlendirme süreçleri de sonuçların yeniden üretilebilmesini sağlamak amacıyla açık olarak paylaşılıyor.

“Yapay zekâyı veri merkezlerinden cihazlara taşıyoruz”

Tether CEO’su Paolo Ardoino konuya ilişkin yaptığı açıklamada, “Teknoloji artık sektörün veri merkezlerine bağımlı yapay zekâ yaklaşımına alternatif sunabilecek olgunluğa ulaştı. Sadece 460 milyon parametreyle sınıfının en iyi kalite ve performansını elde etmemiz, yerel çalışan ve yüksek verimlilik sunan yapay zekânın güçlü bir alternatif olduğunu gösteriyor. Bu araçları doğrudan geliştiricilerin kullanımına açarak merkezi platformlara olan bağımlılığı azaltıyor, güçlü ve gizliliği koruyan yapay zekâyı insanların halihazırda kullandığı cihazlara taşıyoruz.” dedi.

 

  Hibya Haber Ajansı

© Copyright 2026 Su Haber Tüm Hakları Saklıdır.
Web sitemiz Hibya Haber Ajansı Abonesidir.