اگر در شبکههای اجتماعی مثل اینستاگرام و یوتیوب فعال باشید، حتماً دیدهاید که ویدیوهای ASMR مانند خرد کردن صابون، فشردن ژلهای شفاف یا ضربه آرام ناخن روی اشیا چقدر بازدید میلیونی میگیرند.
الان با هوش مصنوعی میتوانید بدون نیاز به دوربینهای گرانقیمت، میکروفونهای چند دهمیلیونی یا استودیوی عایق صدا، ویدیوهای ASMR بسازید؛ ویدیوهایی که هم تصویرشان واقعی است و هم صدای همزمان و گوشنوازی دارند.
در این مقاله یاد میگیرید:
- چطور یک پرامپت ASMR دقیق بنویسید؟
- پرامپت ASMR چگونه باشد که حرکت دستها طبیعی باشد و صدا با تصویر هماهنگ باشد.
- کدام مدلهای هوش مصنوعی برای ساخت ویدیو ASMR مناسبترند.
- چطور با هوشا ویدیو ASMR بسازید.
- چطور خطاهای رایج مثل دفرمه شدن انگشتها یا نویزهای اضافی را برطرف کنید.
ویدیو ASMR چیست؟
اصطلاح ASMR مخفف Autonomous Sensory Meridian Response است و به حس آرامش، حس گزگز ملایم و لذتبخشی گفته میشود که با شنیدن صداهای بسیار ریز و دیدن تصویرهای آرام به انسان دست میدهد.
در دنیای واقعی، این ویدیوها با صداهایی مثل کشیدن آرام ناخن روی چوب، بریدن صابونهای ترد یا له کردن ژلهای رنگی ساخته میشوند.
نمونه ویدیو ASMR ساخته شده در پلتفرم هوش مصنوعی هوشا
در این بخش ویدیوی ۱۵ ثانیهای ساخته شده با مدل Seedance 2.5 در هوشا را مشاهده میکنید. در ادامه مقاله قدم به قدم نحوه ساخت این ویدیو را آموزش خواهید دید:
تصاویر مرجع استفاده شده در این ویدیو
تصویر سوژه را در این قسمت مشاهده میکنید:

در این قسمت نیز تصویر غذایی که سوژه در فیلم میخورد، مشاهده میکنید.

انواع ویدیوهای ASMR
در دنیای ASMR وقتی سراغ ساخت ویدیو با هوش مصنوعی میروید، معمولاً با دو سبک کلی روبهرو میشوید:
- ویدیوهای فانتزی و اشیامحور: این کلیپها بیشتر روی اجسام غیرواقعی تمرکز دارند؛ مثل هندوانهای که از جنس شیشه تراشیده شده یا صابونی که هنگام برش مثل کریستال میدرخشد. این سبک جذابیت بصری دارد، اما مخاطب حس واقعی از آن نمیگیرد.
- ویدیوهای رئال و کاراکترمحور: در این مدل، دستهای یک انسان واقعی در کادر قرار میگیرد و با یک جسم تعامل دارد. ناخنها، بافت پوست و نحوه فشردن جسم کاملاً طبیعی شبیهسازی میشوند. مخاطب با دیدن این ویدیو دقیقاً حس میکند که یک نفر روبهروی او نشسته و در حال لمس اشیاست؛ به همین دلیل این سبک بازدید و ماندگاری مخاطب بسیار بالاتری دارد.
جدول مقایسه انواع ویدیوهای ASMR
| سبک ویدیو | موضوع و نوع صحنه | نوع صداگذاری | حس دریافتی مخاطب |
| انیمیشن و فانتزی | بریدن میوههای شیشهای و اسلایمهای براق | معمولاً بیصدا یا نیازمند افزودن دستی صدا در برنامههای ادیت | بیشتر جنبه تماشای گرافیکی دارد و حس لمس واقعی منتقل نمیشود. |
| رئال و کاراکترمحور | دست انسان در حال لمس، ضربه زدن یا فشردن مواد مختلف | صدای طبیعی و همزمان که درست در لحظه لمس تولید میشود | حس واقعی ASMR، کاهش استرس و تعامل بسیار بالای تماشاگر. |
نکته کلیدی در یک ویدیوی آرامشبخش، هماهنگی دقیق حرکت با صداست؛ اگر دست به جسم برخورد کند اما صدا یک ثانیه دیرتر پخش شود، حس بیننده کاملاً از بین میرود. به همین خاطر، باید از ابزارها و دستورهایی استفاده کنیم که صدا و تصویر را همزمان تولید کنند.
ساخت ویدیو ASMR با هوش مصنوعی
با هوش مصنوعی میتوانیم ویدیوی ASMR بسازیم و همین حس تماس فیزیکی و صداهای ظریف را تنها با هوش مصنوعی بازسازی کنیم، بدون اینکه به فیلمبرداری واقعی نیاز داشته باشیم.
پرامپت ویدیو ASMR چگونه نوشته میشود؟
برای اینکه هوش مصنوعی یک ویدیوی طبیعی بسازد، نباید به یک جمله ساده مثل «یک ویدیوی ASMR برای خوردن غذا بساز» اکتفا کنید.
هوش مصنوعی برای درک صحنه، نیاز به جزئیات مشخص دارد؛ باید دقیقاً بگویید دست چه شکلی است، روی چه میزی قرار دارد، چه حرکتی انجام میدهد و چه صدایی تولید میکند.
پرامپت چیست؟ آموزش پرامپتنویسی با ۲۰ مثال واقعی و تستشده
فرمول پرامپت نویسی ساخت ویدیو ASMR با هوش مصنوعی
برای نوشتن یک پرامپت ویدیو ASMR بدون نقص، از این فرمول ساده استفاده کنید:
[سوژه و ظاهر دست] + [محیط و میز کار] + [یک حرکت آرام و مشخص] + [نوع صدا و کیفیت ضبط] + [ریتم و سرعت ملایم] + [زاویه و کادربندی دوربین] + [نورپردازی] + [محدودیتها]
در دنیای ویدیوهای ASMR، دو قانون طلایی وجود دارد:
- اول اینکه هرگز چند حرکت همزمان را در یک پرامپت ننویسید (مثلاً نباید همزمان بگویید دست جسم را ببرد، سپس بچرخاند و بعد له کند؛ فقط یک کار مشخص را انتخاب کنید).
- دوم اینکه صدا را حتماً بهصورت «نزدیک به میکروفون، استریو و بدون موزیک یا صحبت اضافه» توصیف کنید تا مدل صدای اضافه نسازد.
ساختار پیشنهادی پرامپت ASMR
برای پیادهسازی این فرمول در ساخت ASMR با هوش مصنوعی، کافی است جدول زیر را به عنوان چکلیست جلوی دست خود بگذارید:
| بخش پرامپت | در این بخش چه چیزی بنویسیم؟ | مثال کوتاه کاربردی |
| سوژه (Subject) | سن، تمیزی ناخنها و ظاهر دست را دقیق بنویسید. | Calm woman’s hands with natural manicured nails |
| محیط (Environment) | سطحی مات و ساده مشخص کنید تا بازتاب مزاحم نسازد. | On a dark slate cutting board in a quiet studio |
| حرکت (Action) | یک تکحرکت مشخص را با واژههای آرام توصیف کنید. | Deliberately tapping and pressing fingertips |
| صدا (Audio) | نوع صدای خرد شدن یا فشردن و کیفیت نزدیک آن را بیاورید. | Crisp tactile crunching, near-field binaural ASMR, no music |
| ریتم (Rhythm) | سرعت حرکت را روی آهسته و باحوصله تنظیم کنید. | Extremely slow, rhythmic and deliberate pace |
| دوربین (Camera) | نمای نزدیک و پسزمینه مات را مشخص کنید. | Macro close-up shot, 85mm lens, shallow depth of field |
| نور (Lighting) | نوری نرم انتخاب کنید تا بافت جسم بهخوبی دیده شود. | Soft side-lighting highlighting micro-textures |
| محدودیت (Limits) | لرزش دوربین و حرکات ناگهانی را حذف کنید. | Static tripod framing, zero camera shake |
پرامپت تیم هوشا برای ساخته ویدیو ASMR خوردن غذای ایرانی
تیم هوشا برای تست واقعی یک ویدیوی موکبانگ و ASMR خوردن غذای ایرانی، از پرامپت ساختاریافته زیر استفاده کرده است:
توجه: ویدیوی موکبانگ (Mukbang) نوعی ویدیو است که در آن فرد جلوی دوربین غذا میخورد و معمولاً همزمان با مخاطب صحبت میکند یا صدای خوردن غذا را برجسته میکند.
| SCENE CONTEXT15-second vertical 9:16 home mukbang / eating ASMR clip. A young man sits alone at a table in his own kitchen, facing the camera, and silently eats a home-cooked Persian meal of ghormeh sabzi with saffron rice and crispy tahdig. No talking at all, only close-mic eating sounds. The camera is a phone on a static tripod, like a real food-creator video.ACTIVE REFERENCES@image1 is the man and the kitchen. His face, dark wavy hair with a messy fringe, thick straight eyebrows, thin moustache and short chin beard, and his light sage-grey crewneck t-shirt 100% match the reference. The background 100% matches the kitchen in the reference: warm walnut wood-panel wall, dark grey stone counter with a black coffee machine, glass storage jars, upturned glasses and a wicker utensil pot. Ignore the selfie angle, his raised arm and the blue lens flare in the reference. @image2 is the food. The meal 100% matches the reference: ghormeh sabzi (dark green herb stew with tender beef chunks and red kidney beans in a glossy green-brown sauce), fluffy white basmati rice topped with saffron-yellow grains, golden crispy tahdig triangles, raw red onion rings, shirazi salad of diced tomato and cucumber, whole green olives and long fresh green chilies. Everything is served on white scalloped porcelain with a green floral pattern and gold rim. Ignore the top-down camera angle of the reference. LOCATION MAPThe man sits at a white tabletop in the foreground of his kitchen, torso squared to the camera. The walnut wall and grey counter from @image1 are about 1.5 m behind him, softly out of focus. On the table directly in front of him is his main plate: a mound of rice with a saffron top, ghormeh sabzi spooned beside it, and two tahdig triangles leaning against the rice. Closest to the camera, lined up along the bottom edge of the frame, are three small porcelain dishes: red onion rings on the left, shirazi salad in the center, green olives on the right. Two green chilies lie beside the main plate on screen-right.FIRST FRAME AND SPATIAL BLOCKINGFirst frame: he is already seated and centered, eyes down on his plate, holding a spoon in his right hand (screen-left) and a fork in his left hand (screen-right) above the food. The top of his head sits just below the top of the frame, his face is at the upper-middle of the frame, the tabletop and plate fill the lower third, and the three side dishes line the very bottom edge.FORMAT MODEOne continuous 15-second take, no cuts.OPTICSAbout 75° diagonal field of view, natural smartphone main-camera rectilinear look. Face and food both sharp; kitchen background gently soft. Lens locked for the whole shot.CAMERAThe phone stands on a tripod on the far side of the table, about 1 m from his chest, at roughly his chest height, aimed slightly down so the plate and side dishes read clearly in the foreground and his face sits in the upper frame. Completely locked-off: no push, no pan, no handheld movement.ACTION TIMING0.0-3.0s: He uses the fork to push ghormeh sabzi onto the spoon with rice, lifts a full spoonful, and takes the bite, closing his lips around the spoon and sliding it out clean. His eyes close, he chews slowly and gives a small satisfied nod.3.0-6.5s: He sets the spoon down, picks up a tahdig triangle with his right hand and snaps off a corner with a loud crunch, crumbs falling onto the rice. He dunks the piece into the stew sauce and bites it with a crisp crunch; his eyebrows lift in pleasure.6.5-9.0s: With his fingertips he takes a red onion ring from the front-left dish and bites it raw with a sharp snap, chewing while looking down at his plate.9.0-12.0s: He picks the spoon back up, scoops shirazi salad over a little rice and eats it; a sheen of juice on his lips, he licks his bottom lip.12.0-15.0s: He lifts the second tahdig triangle with both hands and bites a big crunchy chunk, chewing with eyes closed. He licks his thumb, then glances up at the camera with a content half-smile, still chewing as the clip ends.PHYSICSThe loaded spoon has weight and a little sauce drips back to the plate. The tahdig is rigid and brittle: it cracks along a clean fracture into shards and scatters golden crumbs. Rice grains cling to the spoon; the onion ring flexes slightly before it snaps. Chewing shows real jaw motion, cheek movement and a visible throat swallow. Utensils touch the porcelain with real contact. The food on the plate visibly decreases with each bite.LIGHTINGSoft daylight from a window just off camera-left falls across the table and his face, leaving a gentle shadow on his screen-right cheek. Warm ceiling light glows on the walnut wall behind him. Glossy highlights on the stew oil, saffron rice and tahdig crust; his eyes stay clear and readable.AUDIOClose-mic eating ASMR only: spoon clinking on porcelain, soft wet squish of the stew, loud crisp crunch and crackle of tahdig, sharp snap of raw onion, juicy crunch of cucumber, slow chewing, lip smacks, swallowing, quiet breathing through the nose, faint kitchen room tone. No music, no speech, no voiceover.STYLEAuthentic social-media food-creator realism, true-to-life natural colours, crisp phone-video clarity, no film grain, no cinematic colour grade, no on-screen text or subtitles.QUALITYSharp clarity, stable picture, readable face, realistic mouth, teeth and chewing, correct hands with five fingers, utensils stay rigid, natural light motion blur only on quick hand movements, no ghosting, no flicker.POSITIVE CONSTRAINTSExactly one person appears for the whole clip: the man from @image1, seated at the table and facing the camera. The camera stays fixed on the far side of the table the entire time. All food and dishes match @image2. The frame stays vertical 9:16. |
ترجمه روان فارسی پرامپت ویدیو ASMR:
| «فضای صحنه: ویدیوی موکبانگ و ASMR غذا خوردن ۱۵ ثانیهای عمودی (۹:۱۶) در خانه. یک مرد جوان تنها پشت میز آشپزخانه خود نشسته، رو به دوربین است و در سکوت کامل یک وعده غذای خانگی ایرانی شامل قورمهسبزی، برنج زعفرانی و تهدیگ ترد میخورد. اصلاً صحبتی در کار نیست و فقط صداهای نزدیک به میکروفون از غذا خوردن شنیده میشود. دوربین درست مانند ویدیوهای واقعی ولاگرهای غذا، یک گوشی موبایل روی سهپایه ثابت است. تصاویر مرجع فعال: تصویر image1@ مربوط به فرد و آشپزخانه است؛ چهره، موهای موجدار تیره با چتریهای نامرتب، ابروهای پرپشت و صاف، سبیل باریک و ریش کوتاه چانه، و تیشرت یقه گرد خاکستری-سبز او ۱۰۰٪ مطابق تصویر مرجع هستند. پسزمینه نیز ۱۰۰٪ با آشپزخانه مرجع مطابقت دارد: دیوار با پنلهای چوب گردوی گرم، پیشخوان سنگی خاکستری تیره با دستگاه قهوهساز مشکی، شیشههای نگهداری مواد، لیوانهای وارونه و ظرف حصیری قاشق و چنگال. زاویه سلفی، دست بالارفته و انعکاس نور آبی در عکس مرجع نادیده گرفته شود. تصویر image2@ مربوط به غذا است؛ وعده غذایی ۱۰۰٪ مطابق مرجع است: قورمهسبزی (خورش سبزی تیره با تکههای گوشت لطیف و لوبیای قرمز در روغنی براق و سبزرنگ)، برنج سفید باسماتی با تزیین زعفرانی، مثلثهای تهدیگ طلایی و ترد، حلقههای پیاز قرمز خام، سالاد شیرازی با خیار و گوجه نگینی، زیتون سبز درسته و فلفلهای تند سبز تازه. همه غذاها در ظروف چینی دالبری سفید با طرح گل سبز و لبه طلایی سرو شدهاند. زاویه از بالای عکس مرجع نادیده گرفته شود. چیدمان و موقعیت: مرد پشت یک میز سفید در جلوی کادر نشسته و سینهاش کاملاً رو به دوربین است. دیوار چوبی و پیشخوان تصویر image1@ در فاصله حدود ۱.۵ متری پشت سر او با تاری ملایم قرار دارند. روی میز دقیقاً روبهروی او بشقاب اصلی قرار دارد: تپهای از برنج زعفرانی، قورمهسبزی ریختهشده کنار آن، و دو مثلث تهدیگ تکیهدادهشده به برنج. نزدیکترین بخش به دوربین در لبه پایینی تصویر، سه ظرف کوچک چینی چیده شدهاند: پیاز قرمز در سمت چپ، سالاد شیرازی در وسط، و زیتون سبز در سمت راست. دو فلفل سبز در کنار بشقاب اصلی در سمت راست کادر قرار دارند. فریم اول: او از پیش نشسته و در مرکز کادر قرار دارد، چشمانش رو به بشقاب است و در دست راست (سمت چپ تصویر) قاشق و در دست چپ (سمت راست تصویر) چنگال بالای غذا دارد. سرش کمی پایینتر از بالای کادر، چهرهاش در نیمه بالایی، میز و بشقاب در یکسوم پایینی، و سه پیاله در لبه پایین تصویر هستند. فرمت: یک برداشت ممتد ۱۵ ثانیهای بدون هیچ برشی. اپتیک و دوربین: زاویه دید حدود ۷۵ درجه طبیعی با دوربین اصلی گوشی موبایل، چهره و غذا کاملاً شارپ و شفاف، پسزمینه آشپزخانه کمی مات و لنز کاملاً قفلشده. گوشی روی سهپایه در فاصله یک متری سینه او و همارتفاع با سینهاش قرار دارد و کمی رو به پایین است تا بشقاب واضح دیده شود؛ کاملاً ثابت و بدون حرکت دست، چرخش یا زوم. زمانبندی حرکتها: ۰ تا ۳ ثانیه: با چنگال قورمهسبزی را روی قاشق پر از برنج هدایت میکند، قاشق پر را بالا میآورد و لقمه را داخل دهان میگذارد، لبها را دور قاشق میبندد و آن را تمیز بیرون میکشد. چشمهایش را میبندد، آرام میجود و با رضایت سر تکان میدهد. ۳ تا ۶.۵ ثانیه: قاشق را پایین میگذارد، یک تکه تهدیگ مثلثی را با دست راست برمیدارد و گوشهاش را با صدای خرد شدن ترد و بلندی جدا میکند طوری که خردههایش روی برنج میریزد. تکه تهدیگ را داخل سس خورش میزند و با صدایی ترد گاز میزند؛ ابروهایش از روی لذت بالا میرود. ۶.۵ تا ۹ ثانیه: با سرانگشتان یک حلقه پیاز قرمز از پیاله سمت چپ برمیدارد و با صدایی تیز و ترقتوروق گاز میزند و درحالیکه به بشقاب نگاه میکند میجود. ۹ تا ۱۲ ثانیه: دوباره قاشق را برمیدارد، مقداری سالاد شیرازی با کمی برنج پر میکند و میخورد؛ برقی از آب سالاد روی لبهایش میماند و لب پایینش را لیس میزند. ۱۲ تا ۱۵ ثانیه: دومین تکه تهدیگ را با دو دست برمیدارد، یک لقمه ترد بزرگ گاز میزند و با چشمهای بسته میجود. انگشت شستش را لیس میزند، سپس با لبخندی آرام و درحالیکه هنوز در حال جویدن است به دوربین نگاه میکند و کلیپ پایان مییابد. فیزیک حرکت: قاشق پر سنگینی دارد و کمی سس روی بشقاب میچکد. تهدیگ سفت و شکننده است، از خط شکستگی خرد میشود و خردههای طلایی پخش میکند. دانههای برنج به قاشق میچسبند و پیاز قبل از شکستن کمی خم میشود. جویدن همراه با حرکت واقعی فک، گونهها و بلع واضح در گلو است. تماس قاشق و چنگال با چینی کاملاً واقعی است و با هر لقمه از حجم غذای داخل بشقاب کاسته میشود. نورپردازی: نور ملایم روز از پنجره سمت چپ کادر روی میز و چهرهاش میتابد و سایه ملایمی روی گونه راست او میاندازد. نور گرم سقف روی دیوار چوبی میدرخشد. بازتابهای براق روی روغن خورش، برنج زعفرانی و پوست تهدیگ دیده میشود و چشمهایش کاملاً واضح هستند. صدا: فقط صدای ضبط نزدیک (کلوزمایک) غذا خوردن ASMR: برخورد قاشق با چینی، صدای خیس و نرم خورش، خرد شدن و ترقتوروق بلند تهدیگ، شکستن تیز پیاز خام، صدای ترد و آبدار خیار، جویدن آرام، ملچملوچ ملایم لبها، قورت دادن، تنفس آرام از بینی و صدای خفیف اتاق آشپزخانه. بدون هیچ موزیک، صحبت یا صدای گوینده. سبک و کیفیت: رئالیسم واقعی ویدیوهای غذایی شبکههای اجتماعی با رنگهای طبیعی و وضوح بالای گوشی، بدون گرین سینمایی یا متن روی صفحه. چهره واضح، دندانها و جویدن واقعی، دستهای درست با پنج انگشت، قاشق و چنگال محکم و بدون تغییر شکل، و تصویر بدون محوشدگی یا پرش.» |
تحلیل بخشهای مختلف پرامپت ویدیوی ASMR:
- تثبیت چهره و محیط با رفرنسها (ACTIVE REFERENCES): ارجاع به تصاویر ثابت باعث شده هوش مصنوعی در طول ویدیو چهره جوان، مدل مو، ریش و محیط آشپزخانه را بدون کوچکترین تغییری حفظ کند.
- زمانبندی گامبهگام حرکات (ACTION TIMING): مشخص کردن دقیق اینکه در هر ثانیه چه غذایی خورده شود، از تداخل دستها، قاشق و چنگال جلوگیری کرده و حرکتی بسیار نرم و طبیعی ساخته است.
- طراحی دقیق صداهای ریز (AUDIO): توصیف جداگانه صدای ترقتوروق تهدیگ، شکستن پیاز خام و صدای قاشق روی بشقاب، موتور صوتی را وادار کرده صداهایی زنده، تفکیکشده و درست در لحظه برخورد بسازد.
- شبیهسازی قوانین فیزیک (PHYSICS): دستوراتی مثل ریختن خردههای تهدیگ، سنگینی قاشق پر و کم شدن تدریجی محتویات بشقاب، ویدیو را از حالت یک انیمیشن ساده خارج کرده و جلوهای ۱۰۰٪ واقعی به آن بخشیده است.
نمونه قالب پرامپت قابلکپی برای سناریوهای دیگر
اگر میخواهید برای سوژههای دیگر مثل تست سایر غذاها، برش صابون یا لمس اشیا پرامپت ویدیوهای ASMR بسازید، کافی است کلمات داخل کروشه در قالب زیر را عوض کنید:
| SCENE CONTEXT[مدت زمان ویدیو مثلاً 15-second] vertical 9:16 [نوع ASMR مثلاً home mukbang / tactile ASMR clip]. [توصیف سوژه یا فرد] sits at a table and silently [توصیف کار مشخص مثلاً eats / touches / cuts] the [جنس جسم یا خوراکی]. No talking, only close-mic [نوع صداها] sounds. Camera on a static tripod.ACTION TIMING0.0-3.0s: [کنش اول و نحوه شروع حرکت]3.0-8.0s: [کنش دوم و ایجاد صدای اصلی]8.0-15.0s: [کنش نهایی، پایان حرکت و حس رضایت]AUDIOClose-mic ASMR only: [لیست دقیق صداها مثلاً crisp crunch, soft squish, tapping], slow chewing/contact sounds, clean room tone, zero background music, zero speech.CAMERA & LIGHTINGStatic tripod framing, vertical 9:16, [نوع نورپردازی مثلاً soft window daylight], sharp focus on subject, authentic social-media realism. |
اگر برای ساختن ایدههای خلاقانه یا تنظیم دقیق بخشهای زمانی و توصیف صداها به زبان انگلیسی به کمک نیاز دارید، میتوانید از دستیار هوشمند چت جی پی تی بخواهید تا پرامپت انگلیسی شما را بر اساس همین ساختار آماده کند.
آموزش ساخت ویدیو ASMR با هوش مصنوعی هوشا
برای تولید این ویدیوها نیازی به درگیر شدن با سایتهای خارجی، پرداخت دلاری یا دردسرهای اتصال اینترنت ندارید.
ساخت ویدیو با هوش مصنوعی ایرانی (با دیالوگ + امکانات حرفهای)
مراحل ساخت ASMR با هوش مصنوعی در هوشا به این صورت است:
مرحله ۱: ابتدا وارد بخش ساخت ویدیو با هوش مصنوعی در داشبورد هوشا شوید.

مرحله ۲: برای کیفیت و خروجی بهتر و دقیق تر مدل ویدیویی سیدانس ۲.۵ و برای مصرف اعتبار کمتر و خروجی قابل قبول مدل گوگل امنی را میتوانید انتخاب کنید.

مرحله ۳: دو عکس رفرنس را به ترتیب عکس اول کاراکتر و عکس دوم غذا آپلود میکنیم.

مرحله ۴: بعد از آپلود عکس پرامپت را وارد میکنیم و تنظیمات ویدیو را چک میکنیم و روی تولید کن میزنیم.

مرحله ۵: اگر خروجی اول خروجی دلخواهمان بود روی دکمه دانلود میزنیم و ویدیو را دانلود میکنیم.

نمونه خروجی طبق پرامپت بالا با مدل Seedance 2.5 در 10 ثانیه:
برای اینکه ایده خود را همین حالا امتحان کنید، وارد پنل ویدیوساز شوید.
بهترین مدل هوش مصنوعی برای ساخت ویدیو ASMR کدام است؟
برای انتخاب یک هوش مصنوعی ساخت ویدیو ASMR حرفهای، مهمترین معیار این است که مدل بتواند ویدیو و صدا را در یک مرحله و به صورت هماهنگ تولید کند. در گذشته، ابزارها ویدیو را بدون صدا تحویل میدادند و شما مجبور بودید خودتان ساعتها دنبال فایل صوتی بگردید و آن را روی تصویر سینک کنید.
اما امروزه مدلهای نسل جدید، حرکت ماده را درک میکنند و همزمان با ضربه زدن، صدای طبیعی آن را میسازند.
تولید ویدئو با هوش مصنوعی؛ چگونه بدون بازیگر و استودیو محتوای ویدیویی بسازیم؟
امروزه دو مدل برجسته پیشتاز تولید همزمان صدا و تصویر هستند:
۱. مدل Seedance 2.5: این مدل شاهکار شرکت بایتدنس است. مدل هوش مصنوعی Seedanceکنترل فوقالعادهای روی ثبات دستها و انگشتان دارد، فیزیک موادی مثل ژل و آب را کاملاً طبیعی درک میکند و صدای استریوی بسیار تمیزی متناسب با کنش فیزیکی ارائه میدهد.
هوش مصنوعی سی دنس Seedance؛ نمونه خروجی + آموزش ساخت ویدیو
۲. مدل Google Veo 3: این مدل توسط گوگل دیپمایند طراحی شده و توانایی بینظیری در تولید بافتهای سینمایی، نورپردازی عمیق و صدای محیطی دارد. با استفاده از هوش مصنوعی Veo 3 میتوانید ویدیوهایی با ظاهر استودیویی واقعی بسازید.
هوش مصنوعی Veo 3.1 گوگل؛ خرید اکانت و راهنمای کامل استفاده
۳. مدل Kling 2.1: این ابزار کلید فعالسازی افکتهای صوتی دارد، اما در حفظ هماهنگی صدا و جزئیات دستها در مقایسه با Seedance کمی نیاز به آزمون و خطای بیشتری دارد.
| مدل هوش مصنوعی | وضعیت تولید صدا | کیفیت حرکت دست و ماده | بهترین کاربرد برای ASMR |
| Seedance 2.5 | صدای بومی استریو کاملاً هماهنگ با ضربه | عالی؛ حفظ کامل تعداد انگشتان و کشسانی طبیعی ماده | تعامل دست با ژل، اسلایم، میوه و صابون |
| Google Veo 3 | صدای محیطی و فولی بومی با کیفیت بالا | عالی؛ نورپردازی سینمایی و شکست نور در شیشه و آب | سطوح کریستالی، شیشهای و صحنههای ریلکسیشن |
| Kling 2.1 | پشتیبانی از افکت صوتی با تیک Sound Effects | متوسط به بالا؛ احتمال تار شدن دست در حرکات سریع | ویدیوهای ساده اشیامحور و انیمیشن |
نمونه ویدیو ASMR ساخته شده مدل Google Omni
در این قسمت همان ویدیو را با همان پرامپت توسط هوش مصنوعی Google Omni در هوشا میسازیم.

نمونه خروجی طبق پرامپت تستی با مدل Google Omni در 10 ثانیه:
بررسی و تحلیل عملکرد هوشا در تولید ویدیو ASMR
بررسی نتیجه تست عملی تیم هوشا نشان میدهد که هوش مصنوعی ساخت ASMR در بازآفرینی صحنههای پیچیده کاراکترمحور مانند موکبانگ و غذا خوردن به سطح چشمگیری از واقعگرایی رسیده است.
در این آزمایش که با سناریوی قورمهسبزی و تهدیگ ترد انجام شد، خروجی بهدستآمده نقاط قوت درخشان و نکات فنی مشخصی را نشان داد.
نقاط قوت در تست عملی:
- ثبات کامل چهره، ریش و موهای کاراکتر در تمام ۱۵ ثانیه بدون کوچکترین پرش پیکسلی یا تغییر قیافه به دلیل پایبندی به عکس مرجع image1@ حفظ شد.
- هماهنگی صدای خرد شدن تهدیگ و گاز زدن پیاز با حرکت دهان فوقالعاده بود و صدا دقیقاً در همان لحظه گاز زدن و بسته شدن دندانها پخش شد.
- وسایل غذاخوری مثل قاشق و چنگال فلزی فرم صلب و طبیعی خود را حفظ کردند و دستها با پنج انگشت درست و بدون به هم ریختگی قاشق را بالا آوردند.
- فیزیک غذا کاملاً باورپذیر بود؛ تکههای تهدیگ با شکستن خرد شدند، خردههای طلایی روی برنج ریخت و حجم غذای بشقاب با هر لقمه کمتر شد.
چالشها و راهحل رفع آنها:
در صورتی که بازههای زمانی (Action Timing) در پرامپت قید نشود، مدل ممکن است تلاش کند چند حرکت را همزمان انجام دهد که باعث انحنا پیدا کردن دسته قاشق یا ناپدید شدن تهدیگ در فریمهای میانی میشود. راهحل قطعی برای رفع این ایراد، تعریف دقیق ثانیهها برای هر لقمه و درج قیود بازدارنده مثل utensils stay rigid, correct hands with five fingers در متن پرامپت است تا تصویر کاملاً پایدار بماند.
ساخت ویدیو واقعی با هوش مصنوعی؛ آموزش کامل از عکس تا ویدیو حرفهای
خطاهای رایج در ساخت ویدیو ASMR و راهحل آنها
هنگام کار با ابزارهای تولید ویدیو ممکن است با اشکالاتی در تصویر یا صدا مواجه شوید. جدول زیر به شما کمک میکند هر مشکل در ویدیو هوش مصنوعی ASMR را در چند ثانیه شناسایی و رفع کنید:
| ایراد مشاهدهشده در ویدیو | علت اصلی بروز مشکل | راهکار سریع و اصلاح پرامپت |
| صدا با تصویر هماهنگ نیست | توصیف جداگانه زمان صدا و حرکت | حرکت و صدا را در یک عبارت بنویسید: sound emitted at the exact moment of touch |
| انگشتها غیرطبیعی یا اضافه میشوند | درخواست حرکات تند و پیچیده دست | حرکت را به یک ضربه ساده عمودی محدود کنید و بنویسید: anatomically precise hand, simple downward tap |
| صدای تولیدشده بیش از حد بلند است | استفاده از صفتهایی مثل Loud یا Ultra | از عبارتهای استاندارد میکروفون استفاده کنید: delicate low-gain, subtle near-field audio |
| تصویر لرزش غیرعادی دارد | مشخص نکردن وضعیت سهپایه دوربین | اول پرامپت قید کنید: locked-off tripod shot, completely still camera |
| حرکتها قاطی میشوند و تصویر خراب است | نوشتن چند کار مختلف در یک پرامپت | فقط یک کار مشخص را بخواهید؛ مثلاً فقط برش زدن یا فقط لمس کردن |
| بافت اجسام مصنوعی و پلاستیکی است | نبود نورپردازی مایل و سایههای ملایم | نور را تنظیم کنید: soft directional side lighting, realistic surface texture |
ساخت ویدیوی ASMR با هوشا چه مزیتی دارد؟
ساخت محتوا برای کاربران ایرانی همیشه با دردسرهایی مثل تحریم، قطعی ویپیان و نداشتن کارتهای اعتباری بینالمللی همراه بوده است . هوشا به عنوان یک پلتفرم هوش مصنوعی کامل، محیطی فراهم کرده که همه این موانع را دور میزند و بهترین سرویسهای جهانی را یکجا در اختیارتان قرار میدهد.
مهمترین مزایای کار با هوشا در تولید هوش مصنوعی ASMR:
- دسترسی به بهترین مدلها در یک پنل: نیازی به ثبتنام در دهها سایت مختلف ندارید؛ ابزارهای برتر ویدیوساز در دسترس شما هستند .
- پرداخت ریالی آسان: هزینهها را بدون نیاز به حسابهای خارجی یا رمزارز پرداخت میکنید.
- محیط کاملاً فارسی و سریع: کار با بخش هوش مصنوعی آنلاین در هوشا بسیار ساده است و نیازی به دانش فنی پیچیده ندارد.
- دانلود مستقیم و باکیفیت: برای دانلود هوش مصنوعی ASMR و ذخیره ویدیوها نیاز به نرمافزار جانبی ندارید و فایل را با بهترین کیفیت دریافت میکنید.
نکته مهم درباره اعتبارات: در پلتفرم هوشا، روزانه ۲۰ گفتوگوی رایگان برای چت جیپیتی در نظر گرفته شده است؛ اما بخش تولید ویدیو به دلیل نیاز به سرورهای گرافیکی فوقالعاده قدرتمند، نیازمند شارژ حساب کاربری متناسب با مدت رندر است .
نویسنده: معین معرک نژاد
آیا واقعاً میتوان با هوش مصنوعی ویدیوی ASMR صدادار ساخت؟
بله؛ مدلهای ویدیویی نسل جدید به قابلیت تولید صدای بومی مجهز هستند و میتوانند همزمان با لمس یا برش جسم، صدای متناسب با آن را بدون نیاز به ابزار جداگانه بسازند.
بهترین مدل برای ساخت ویدیوی ASMR با دست و صدای واقعی چیست؟
مدلهای Seedance 2.5 و Google Veo 3 بهترین خروجی را دارند، زیرا فیزیک ماده را بهخوبی درک میکنند و دستها را با فرم کاملاً طبیعی نمایش میدهند.
پرامپت ویدیوی ASMR چه بخشهایی دارد؟
پرامپت مناسب باید شامل ظاهر دست، جنس سطح، یک حرکت آرام، نوع صدای نزدیک، زاویه لنز ماکرو، نور نرم و دوربین ثابت روی سهپایه باشد.
چطور صدا را با حرکت دست هماهنگ کنیم؟
باید در پرامپت خود قید کنید که صدا دقیقاً در لحظه تماس ایجاد شود و از نوشتن چند حرکت پیچیده همزمان خودداری کنید.
آیا برای ساخت و دانلود ویدیو در هوشا باید نرمافزار نصب کنیم؟
خیر؛ کلیه مراحل ساخت و دانلود به صورت آنلاین داخل مرورگر انجام میشود و هیچ نیازی به نصب اپلیکیشن نیست.
علت به هم ریختن فرم انگشتها در ویدیو چیست؟
حرکات ناگهانی دوربین یا نوشتن کارهای متعدد در پرامپت باعث این خطا میشود؛ با انتخاب یک حرکت ساده و آهسته، دستها کاملاً طبیعی میمانند.
هوش مصنوعی درسی چیست؟ آموزش تصویری + معرفی دستیار معلم هوشا
ساخت ویدیو ASMR با هوش مصنوعی ۰ تا ۱۰۰ (تست واقعی پرامپت)
HitPaw Edimakor چیست؟ بررسی قابلیتها، محدودیتها و قیمت پلنها
هوش مصنوعی دریمینا (Dreamina) | بررسی قابلیتها، محدودیتها و قیمت
ایجنت هوش مصنوعی؛ از تعریف و کاربرد تا امنیت و هزینه AI Agent