این پروژه متوقف شده است؛ دموی تحقیقاتی مایکروسافت (۲۰۲۳) که ChatGPT را به مدلهای بینایی وصل میکرد تا در چت عکس بفهمد، بسازد و ویرایش کند.
معرفی: ویژوال چتجیپیتی
ویژوال چتجیپیتی در زمانی که ChatGPT هنوز فقط متن میفهمید، با زنجیرهکردن مدلهای بینایی (ControlNet ،Stable Diffusion ،BLIP و…) امکان گفتگو با تصویر را فراهم کرد و بعداً به TaskMatrix تغییر نام داد. پروژهای متنباز و صرفاً پژوهشی بود که باید خودتان با کلید OpenAI روی سیستم/سرور اجرا میکردید؛ ریپوی گیتهاب آن مدتهاست آرشیو شده و بهروزرسانی نمیشود.
دلیل مرگش ساده است: مدلهای چندوجهی بومی مثل GPT-4o و نسلهای بعدی، دیدن و ساختن تصویر را داخل خود ChatGPT و Gemini آوردند و نیاز به این معماری واسطه از بین رفت. امروز برای همین کارها مستقیم از ChatGPT یا Gemini استفاده کنید؛ ارزش این ریپو فقط تاریخی و آموزشی است.
تصاویر محیط ابزار
نقاط قوت
- ✓از پیشگامان اتصال LLM به مدلهای بینایی (ارزش تاریخی)
- ✓متنباز با پیادهسازی قابل مطالعه
نقاط ضعف
- ✗توسعه متوقف شده و ریپو آرشیو است
- ✗راهاندازی سنگین و وابسته به GPU و کلید API
- ✗کارکردش کاملاً با GPT-4o و مدلهای چندوجهی جایگزین شده
نظرات کاربران
هنوز نظری ثبت نشده — اولین نفر باشید!
ابزارهای مشابه

نانوبنانا
Nano Banana
مدل معروف تولید و ویرایش تصویر گوگل؛ عکس واقعگرایانه میسازد، چهره و جزئیات را در چند ویرایش پیاپی ثابت نگه میدارد و پرامپت فارسی را میفهمد — داخل اپ Gemini و AI Studio.

کانوا
Canva
محبوبترین ابزار طراحی آنلاین قالبمحور که مجموعه هوش مصنوعی Magic Studio (مجیک رایت، مجیک دیزاین، مجیک مدیا) را هم دارد؛ سریعترین مسیر از ایده تا پست، پوستر یا ارائه آماده.

اسلایدزگو
Slidesgo
یکی از بزرگترین کتابخانههای قالب رایگان پاورپوینت و گوگلاسلایدز + سازنده ارائه با هوش مصنوعی؛ عضو خانواده Freepik.


