ساخت عکس با هوش مصنوعی یعنی شما یک توصیف متنی (پرامپت) مینویسید و مدل در چند ثانیه تصویری کاملاً جدید میسازد؛ از عکس محصول و کاور مقاله تا تصویرسازی کتاب کودک. در سال ۲۰۲۶ مدلهایی مثل GPT Image 2، Flux، Grok Imagine و میدجرنی کیفیت را به حدی رساندهاند که تشخیص بعضی خروجیها از عکس واقعی سخت است. در این راهنما بهترین مدلهای تولید تصویر با هوش مصنوعی را مقایسه میکنیم، ساختار یک پرامپت خوب را یاد میگیریم، ۱۰ پرامپت آماده میبینیم و نکتههای حقوقی استفادهی تجاری را مرور میکنیم.
ساخت عکس با هوش مصنوعی چطور کار میکند؟
مدلهای تصویرساز روی میلیونها جفت «تصویر و توضیح» آموزش دیدهاند و یاد گرفتهاند از روی متن، تصویری بسازند که با توضیح جور باشد. شما کارگردانید و مدل، عکاس و نقاش.
بیشتر مدلهای امروزی از یکی از دو رویکرد استفاده میکنند: مدلهای انتشاری (Diffusion) که از یک تصویر پر از نویز شروع میکنند و قدمبهقدم آن را تمیز میکنند، و مدلهای چندوجهی که مثل GPT Image 2 قبل از کشیدن دربارهی پرامپت «فکر» میکنند. طبق گزارشها، GPT Image 2 که در ۱ اردیبهشت ۱۴۰۵ (۲۱ آوریل ۲۰۲۶) منتشر شد، اولین مدل تصویری OpenAI با حالت استدلال پیش از تولید است و متن داخل تصویر را بسیار دقیقتر از نسلهای قبل مینویسد.
نکته: حتی بهترین مدلها در نوشتن متن فارسی داخل تصویر گاهی خطا دارند. اگر تیتر فارسی لازم دارید، تصویر را بدون متن بسازید و نوشته را در Canva، فیگما یا فتوشاپ اضافه کنید.
بهترین مدلهای تولید تصویر با هوش مصنوعی در ۲۰۲۶
پاسخ کوتاه: برای دقت در اجرای پرامپت و متن داخل تصویر GPT Image 2، برای عکسگونه و کنترل حرفهای FLUX، برای ویرایش با چند تصویر مرجع Grok Imagine Image 2.0 و برای حس هنری خاص Midjourney (فقط از سایت خودش).
مقایسهی مدلهای ساخت عکس با هوش مصنوعی (قیمتهای دلاری فهرست رسمی، مهر ۱۴۰۵)
مدل
سازنده
نقطهی قوت
قیمت تقریبی
GPT Image 2
OpenAI
درک دقیق پرامپت، متن داخل تصویر، تا 2K
توکنی؛ ۵ دلار ورودی و ۳۰ دلار خروجی / ۱M توکن
FLUX 3 Image
Black Forest Labs
نسل جدید چندوجهی، کیفیت عکسگونه
از حدود ۰٫۰۵ دلار برای هر تصویر 1K
FLUX.2 [pro] / [max]
Black Forest Labs
واقعگرایی، کنترل سبک، قیمت مناسب
از ۰٫۰۳ / ۰٫۰۷ دلار
FLUX.1 Kontext [pro]
Black Forest Labs
ویرایش تصویر با دستور متنی
۰٫۰۴ دلار
Stable Image Ultra
Stability AI
جزئیات بالا، سبکهای متنوع
۰٫۰۸ دلار
Nano Banana 2 (Gemini 3.1 Flash Image)
Google
ویرایش گفتوگومحور و سریع
حدود ۰٫۰۶۷ دلار
Grok Imagine Image 2.0
xAI
ویرایش با تا ۵ تصویر مرجع
۰٫۰۴ دلار
Midjourney V8.1
Midjourney
زیباییشناسی هنری
اشتراک ماهانه؛ API رسمی ندارد
قیمتها برای مقایسهاند و به اندازه و کیفیت تصویر بستگی دارند. قیمت تومانی هر مدل را در صفحهی مدلها ببینید.
GPT Image 2
مدل تصویری OpenAI که در ChatGPT با نام «ChatGPT Images 2.0» شناخته میشود. نقطهی قوت اصلی آن اجرای دقیق پرامپتهای پیچیده (چند شیء، چیدمان مشخص، رنگهای معین) و نوشتن متن خوانا در تصویر است. خروجی تا وضوح 2K و نسبتهای متنوع را پشتیبانی میکند. نسخهی جدیدتر GPT Image 2.5 Flare هم با همان قیمت توکنی عرضه شده است.
Flux (فلاکس)
Black Forest Labs در تیر ۱۴۰۵ نسل FLUX 3 را معرفی کرد که روی تصویر، ویدیو و صدا همزمان آموزش دیده است. خانوادهی FLUX.2 همچنان برای عکسهای واقعگرا و قیمت پایین بسیار محبوب است و FLUX Kontext برای ویرایش متنی تصویر («پسزمینه را عوض کن، محصول بماند») کاربرد دارد.
Grok Imagine، جمنای و Stable Image
Grok Imagine Image 2.0 که مرداد ۱۴۰۵ منتشر شد، طبق ادعای xAI در ردهبندیهای عمومی پس از GPT Image 2 در جایگاه دوم قرار گرفته و ویرایش با چند تصویر مرجع را خوب انجام میدهد. Nano Banana 2 از گوگل برای ویرایشهای سریع در گفتوگو مناسب است و Stable Image Ultra گزینهای باسابقه با کنترل سبک بالا است.
میدجرنی
میدجرنی همچنان برای تصاویر هنری و سینمایی محبوب است و نسخهی V8.1 از تیر ۱۴۰۵ مدل پیشفرض آن شده است. اما میدجرنی API رسمی ندارد و قوانینش دسترسی خودکار را ممنوع کرده است؛ پس فقط از سایت و دیسکورد خودش با اشتراک ارزی قابل استفاده است. سرویسهایی که «API میدجرنی» میفروشند، رسمی نیستند.
آناتومی یک پرامپت خوب برای تولید تصویر
یک پرامپت تصویری خوب شش بخش دارد: سوژه، جزئیات، محیط، سبک، نور و ترکیببندی، و محدودیتها. لازم نیست همه را بنویسید، ولی هرچه دقیقتر بگویید، مدل کمتر حدس میزند.
اجزای پرامپت تصویری و نمونهی هرکدام
بخش
چه بنویسیم؟
نمونه (انگلیسی)
سوژه
چه چیزی یا چه کسی
a handmade turquoise ceramic mug
جزئیات
جنس، رنگ، حالت، احساس
glossy glaze, slightly uneven rim
محیط
کجا و چه زمانی
on a light oak table, morning
سبک
عکس، آبرنگ، سهبعدی، وکتور
studio product photo / clay 3D
نور و ترکیببندی
جهت نور، لنز، زاویه، نسبت
soft window light, 85mm, centered
محدودیتها
چه چیزی نباشد
no text, no logos, no people
چرا پرامپت انگلیسی؟ بیشتر دادههای آموزشی مدلهای تصویری انگلیسی است و اصطلاحات عکاسی (bokeh، rim light، 35mm) دقیقتر فهمیده میشوند. مدلهایی مثل GPT Image 2 فارسی را هم میفهمند، اما اگر نتیجه دقیق نبود، از یک مدل زبانی در پنل چت هوشی بخواهید توصیف فارسی شما را به پرامپت انگلیسی تصویری تبدیل کند. برای اصول کلیتر، راهنمای مهندسی پرامپت را ببینید.
پرامپت نمونه برای تبدیل ایدهی فارسی به پرامپت تصویری
تو یک کارگردان هنری هستی. ایدهی من را به یک پرامپت انگلیسی دقیق برای مدل تصویرساز تبدیل کن که سوژه، جزئیات، محیط، سبک، نور، لنز و محدودیتها را داشته باشد. سه نسخه با سبکهای متفاوت بده. ایده: «یک فنجان چای کنار پنجره در یک صبح بارانی پاییزی».
نمونههای واقعی: پرامپت و خروجی
سه تصویر زیر را خودمان برای همین مقاله با GPT Image 2 ساختهایم؛ پرامپت دقیق هرکدام زیر تصویر آمده است تا ببینید هر بخش پرامپت چه اثری دارد.
پرامپت: A cozy traditional Persian teahouse interior at golden hour, steam rising from small glass tea cups on a brass tray, turquoise tiled walls, warm cinematic lighting, 35mm photo, shallow depth of field, no text — مدل: GPT Image 2
در این نمونه «golden hour» و «warm cinematic lighting» نور گرم را ساختهاند و «shallow depth of field» پسزمینه را محو کرده تا استکانها سوژهی اصلی شوند.
پرامپت: Studio product photo of a handmade turquoise ceramic mug on a light oak table, soft window light from the left, minimalist mint background, high detail, no text, no logos — مدل: GPT Image 2
ترکیب «studio product photo» و «minimalist background» یک عکس فروشگاهی تمیز ساخته است؛ «soft window light from the left» جهت سایه را کنترل میکند.
پرامپت: Isometric 3D clay-style illustration of a small Iranian rooftop garden at night with hanging lanterns, potted pomegranate tree and a crescent moon, soft teal and lavender palette, no text — مدل: GPT Image 2
اینجا سبک (isometric 3D clay) و پالت رنگ (teal and lavender) تعیینکنندهاند؛ با عوضکردن همین دو بخش، کل حالوهوای تصویر تغییر میکند.
۱۰ پرامپت آماده برای ساخت عکس با هوش مصنوعی
این پرامپتها را کپی کنید، سوژه را با نیاز خودتان عوض کنید و نتیجه را در چند مدل مقایسه کنید.
۱. عکس محصول برای فروشگاه اینترنتی
Studio product photo of a pair of handmade leather sandals on a light terrazzo pedestal, soft diffused daylight from the left, pastel mint background, subtle shadow, 85mm lens, ultra sharp, no text, no logos
یک عکس محصول تمیز و یکدست برای صفحهی فروشگاه یا اینستاگرام. نور، زاویهی لنز و رنگ پسزمینه را مشخص کردهایم تا سری عکسها هماهنگ شوند.
۲. تصویر شاخص مقاله
Editorial flat illustration of a person organizing floating calendar blocks and checklists, calm teal and lavender palette, generous negative space on the right, modern minimal style, no text
برای کاور بلاگ یا لینکدین. «فضای خالی سمت راست» را خواستهایم تا بعداً تیتر را در نرمافزار طراحی رویش بنویسید.
۳. پرترهی سبک عکاسی
Natural-light portrait of an elderly Iranian carpet weaver smiling at her loom, warm afternoon light through a window, shallow depth of field, documentary photography style, Kodak Portra film look
پرترهی مستندگونه با حس فیلم آنالوگ. این تصویر یک «شخصیت ساختگی» است؛ از آن بهعنوان عکس واقعی یک فرد مشخص استفاده نکنید.
۴. لوگو و آیکون (برای ایدهپردازی)
Minimal geometric logo concept for a tea brand, a single tea leaf merged with a crescent shape, flat vector, two colors deep teal and cream, centered on white, no text
برای ایدهگرفتن عالی است، اما لوگوی نهایی را یک طراح باید وکتور و ثبت کند (بخش حقوق تجاری را بخوانید).
۵. استوری تبلیغاتی
Vertical 9:16 lifestyle photo of an iced saffron latte on a café table by a sunny window, pistachio crumbs on top, bokeh background, appetizing, vibrant but natural colors, no text
برای استوری کافه یا رستوران. نسبت تصویر عمودی را در تنظیمات استودیو هم انتخاب کنید.
۶. تصویرسازی کتاب کودک
Children's book watercolor illustration of a small fox and a hoopoe bird sharing pomegranates under a big plane tree, soft pastel colors, gentle and whimsical, white paper texture
سبک آبرنگ با شخصیتهای آشنای فرهنگ ایرانی (هدهد، درخت چنار، انار). برای یکدست ماندن شخصیتها در صفحات بعد، از تصویر مرجع استفاده کنید.
۷. فضای داخلی و معماری
Interior design render of a small modern Tehran apartment living room, light oak floor, built-in bookshelves, a Persian rug with geometric pattern, large window with city view at dusk, warm ambient lighting, photorealistic
برای ایدهگرفتن در چیدمان منزل یا ارائه به مشتری معماری داخلی.
۸. بکگراند ارائه و اسلاید
Abstract soft gradient background with flowing translucent waves in teal, mint and lavender, smooth and calm, lots of empty space, 16:9, no text
پسزمینهی ساده و بیمتن برای اسلاید، وبینار یا بنر سایت.
۹. شخصیت سهبعدی و ماسکات
Cute 3D character of a fluffy cream Persian cat robot with a teal headset and a glowing antenna, sitting and waving, soft clay render, studio lighting, pastel background, no text
همین پرامپت با کمی تغییر، ماسکات خود هوشی را میسازد. برای برند خودتان رنگ، حیوان و لوازم شخصیت را عوض کنید.
۱۰. ویرایش با تصویر مرجع
Using the attached photo of my product, keep the bottle exactly the same but place it on a wet black stone surface with water droplets, dramatic rim lighting, dark moody background
این پرامپت همراه یک تصویر آپلودشده کار میکند؛ مدل محصول را ثابت نگه میدارد و فقط صحنه را عوض میکند. GPT Image 2، FLUX Kontext و Grok Imagine در این کار قویاند.
ویرایش تصویر و کار با تصویر مرجع
ویرایش با هوش مصنوعی یعنی یک تصویر موجود را آپلود کنید و با دستور متنی بخشی از آن را تغییر دهید؛ مثلاً پسزمینه را عوض کنید، رنگ لباس را تغییر دهید یا شیئی را حذف کنید.
تغییر پسزمینه: «محصول را دقیقاً حفظ کن و پسزمینه را ساحل در غروب کن».
یکدستی شخصیت: تصویر شخصیت را بهعنوان مرجع بدهید و صحنهی جدید بخواهید؛ برای کتاب کودک و کمیک ضروری است.
انتقال سبک: یک عکس بدهید و بخواهید آبرنگی یا سهبعدی شود.
ویرایش موضعی: «فقط لیوان روی میز را حذف کن، بقیه تغییر نکند».
هشدار: عکس افراد دیگر را بدون اجازهی آنها ویرایش نکنید و تصاویر جعلی از اشخاص واقعی (بهویژه در موقعیتهای گمراهکننده) نسازید. بیشتر سرویسها این کار را ممنوع کردهاند و ممکن است پیامد قانونی داشته باشد.
استفادهی تجاری و مالکیت تصاویر هوش مصنوعی
پاسخ کوتاه: بیشتر سرویسهای پولی استفادهی تجاری از خروجی را مجاز میدانند، اما «مالکیت معنوی» تصویری که فقط با پرامپت ساخته شده، در بسیاری از کشورها محل تردید است.
دفتر کپیرایت آمریکا در گزارش ژانویهی ۲۰۲۵ خود اعلام کرد که صرفِ نوشتن پرامپت برای «مؤلف» شمردهشدن کافی نیست و فقط بخشهایی از اثر که انسان بهطور خلاقانه انتخاب، چیدمان یا ویرایش کرده، قابل حمایت است. یعنی اگر لوگوی شما کاملاً با هوش مصنوعی ساخته شده باشد، ممکن است نتوانید جلوی کپی آن را بگیرید.
برای لوگو و هویت بصری، خروجی هوش مصنوعی را فقط ایده بدانید و نسخهی نهایی را طراح بسازد.
نام و سبک هنرمندان زنده، شخصیتهای دارای کپیرایت و برندهای تجاری را در پرامپت تجاری به کار نبرید.
شرایط استفادهی هر مدل را بخوانید؛ مجوزها بین سرویسها و پلنها فرق دارد.
برای شفافیت، در جاهایی که مخاطب ممکن است فریب بخورد (خبر، آگهی ملک، عکس محصول واقعی)، بنویسید که تصویر ساختهی هوش مصنوعی است.
آموزش قدمبهقدم ساخت عکس در استودیوی تصویر هوشی
در هوشی بدون VPN و با پرداخت تومانی به چند مدل تصویرساز از یکجا دسترسی دارید و میتوانید یک پرامپت را در چند مدل امتحان کنید.
بیشتر نتیجههای ضعیف از پرامپت مبهم یا انتظار غیرواقعی میآید، نه از مدل.
کارهای درست
سوژهی اصلی را اول جمله بیاورید
سبک و نور را صریح بنویسید
محدودیتها را مشخص کنید (no text)
یکبار فقط یک چیز را تغییر دهید
کارهای اشتباه
پرامپت دو کلمهای مثل «یک گربهی زیبا»
درخواست متن فارسی طولانی داخل تصویر
ده سوژهی متفاوت در یک تصویر
استفادهی تجاری بدون خواندن مجوز
به نسبت تصویر هم از ابتدا فکر کنید. اگر تصویر را مربع بسازید و بعد برای کاور افقی برش بزنید، بخشی از سوژه از دست میرود. برای کاور سایت و یوتیوب نسبت افقی ۱۶ به ۹، برای پست اینستاگرام مربع یا ۴ به ۵ و برای استوری و ریلز عمودی ۹ به ۱۶ را انتخاب کنید. وضوح بالاتر هم هزینهی بیشتری دارد؛ برای پیشنویس و آزمودن ایدهها کیفیت متوسط کافی است و فقط نسخهی نهایی را با کیفیت بالا بسازید. این کار هم سریعتر است و هم اعتبار کمتری مصرف میکند.
آخرین نکته: دستها، انگشتها و اشیای کوچک هنوز گاهی عجیب درمیآیند. قبل از انتشار، تصویر را بزرگ کنید و جزئیات را بررسی کنید. اگر برای همین تصاویر صداگذاری هم لازم دارید، راهنمای تبدیل متن به صدا را بخوانید و برای مقایسهی کلی مدلها به مقایسهی بهترین مدلهای هوش مصنوعی ۲۰۲۶ سر بزنید.
سوالات متداول
بهترین هوش مصنوعی برای ساخت عکس کدام است؟
+
در مهر ۱۴۰۵، GPT Image 2 از OpenAI در اجرای دقیق پرامپت و متن داخل تصویر پیشتاز است. FLUX برای عکسهای واقعگرا و قیمت پایین، Grok Imagine Image 2.0 برای ویرایش با چند تصویر مرجع و میدجرنی برای حس هنری خاص محبوباند. انتخاب نهایی به کاربرد شما بستگی دارد؛ بهتر است یک پرامپت را در چند مدل امتحان کنید.
آیا ساخت عکس با هوش مصنوعی رایگان است؟
+
بیشتر مدلهای باکیفیت هزینهی هر تصویر را جداگانه حساب میکنند، معمولاً بین چند سنت تا حدود ده سنت دلار برای هر تصویر. در هوشی پلن رایگان برای امتحانکردن وجود دارد و برای استفادهی بیشتر میتوانید پلن ماهانهی تومانی بگیرید. قیمت تومانی هر مدل در صفحهی مدلها آمده است.
پرامپت تصویر را فارسی بنویسم یا انگلیسی؟
+
مدلهای جدید مثل GPT Image 2 فارسی را میفهمند، اما پرامپت انگلیسی معمولاً نتیجهی دقیقتری میدهد، چون بیشتر دادههای آموزشی و اصطلاحات عکاسی انگلیسیاند. راه ساده این است که ایده را فارسی به یک مدل زبانی مثل Claude یا GPT-5.5 بدهید و بخواهید آن را به پرامپت تصویری انگلیسی دقیق تبدیل کند.
چرا متن فارسی داخل عکسهای هوش مصنوعی خراب میشود؟
+
مدلهای تصویری حروف را مثل شکل یاد میگیرند و دادهی آموزشی خط فارسی، با اتصال حروف و راستبهچپ بودن، نسبتاً کم است. با اینکه GPT Image 2 در خطوط غیرلاتین پیشرفت کرده، هنوز احتمال خطا وجود دارد. بهترین روش ساختن تصویر بدون متن و اضافهکردن تیتر فارسی در نرمافزار طراحی است.
آیا میتوانم از عکسهای هوش مصنوعی در کسبوکارم استفاده کنم؟
+
اغلب سرویسهای پولی استفادهی تجاری از خروجی را مجاز میدانند، اما شرایط هر سرویس را باید خواند. نکتهی مهم این است که تصویری که فقط با پرامپت ساخته شده، در بسیاری از کشورها حمایت کپیرایت کامل ندارد. از نام برندها، شخصیتهای دارای حق نشر و چهرهی افراد واقعی بدون اجازه استفاده نکنید.
آیا میدجرنی را میشود در هوشی یا از طریق API استفاده کرد؟
+
خیر. میدجرنی تا مهر ۱۴۰۵ هیچ API رسمی منتشر نکرده و قوانینش دسترسی خودکار را ممنوع کرده است؛ تنها راه رسمی، سایت میدجرنی و دیسکورد با اشتراک ماهانه است. در هوشی میتوانید از جایگزینهایی مثل GPT Image 2، FLUX و Grok Imagine استفاده کنید که کیفیت رقابتی دارند.
چطور یک شخصیت را در چند تصویر یکسان نگه دارم؟
+
تصویر اول شخصیت را بهعنوان تصویر مرجع به مدل بدهید و در پرامپت بنویسید ظاهر شخصیت دقیقاً حفظ شود و فقط صحنه یا حالت تغییر کند. مدلهایی مثل GPT Image 2، FLUX Kontext و Grok Imagine Image 2.0 که از چند تصویر مرجع پشتیبانی میکنند، در این کار بهترند. توصیف ثابت شخصیت را هم در همهی پرامپتها تکرار کنید.