از نظر معماری هم مدلهای گوگل (Gemini) از پایه بهصورت Natively Multimodal آموزش دیدن؛ یعنی درک تصویر جزو ذات مدلشونه، نه یک ماژول بینایی جداگونه که بعداً به یک مدل متنی وصل شده باشه. ترکیب این با تجربه سالهای طولانی گوگل روی Lens و یوتیوب، میتونه شاهکار بشه.