Alternatives

MiniMax M3 يقرأ الفيديو. ولا يستطيع إخراج إطار واحد — وهذا هو النموذج الذي يستطيع.

MiniMax M3 يأخذ الفيديو دخلًا ويكتب نصًّا خرجًا — ولا يعيد إطارًا مُخرَجًا أبدًا. أي نموذج من MiniMax يصنع الفيديو فعلًا، وماذا يرى M3 في المقطع.

8 دقائق قراءةهيئة التحريرهيئة التحرير
MiniMax M3 يقرأ الفيديو. ولا يستطيع إخراج إطار واحد — وهذا هو النموذج الذي يستطيع.

MiniMax M3 لا يولّد فيديو، ولم يفعل قطّ. هو يأخذ الفيديو دخلًا — حتى نحو ثلاثين دقيقة من اللقطات في طلب واحد — ويكتب نصًّا خرجًا. أوصافًا، ونقدًا، وقوائم لقطات، وشيفرة. أما نموذج MiniMax الذي يُخرج الفيديو فهو H3، الصادر بعد M3 بشهرين، ويفصل بينهما حرف واحد في نصّ الواجهة البرمجية.

وهناك طريقان أوصلاك إلى هنا، ويحتاجان جوابين متعاكسين.

إن جئت تبحث عن مولد فيديو من MiniMax M3، فالنموذج الذي تريده اسمه H3 وتستطيع صنع مقطع به الآن — الشركة نفسها، والحرف الصحيح. وإن كنت تقصد M3 فعلًا وتريد أن تعرف ماذا يفعل باللقطات، فتابع القراءة. الجواب أدقّ بكثير من «لا شيء»، والحدّ الحقيقي ليس الحدّ المكتوب في ورقة المواصفات.

هل يستطيع MiniMax M3 توليد فيديو؟

لا. ذهبتُ إلى وسم خطّ الإنتاج أولًا، لأنه يحسم السؤال في بحث واحد وتستطيع أنت تكراره في أقل من دقيقة.

MiniMax M3MiniMax H3
وسم خطّ الإنتاج على Hugging Faceimage-text-to-textimage-text-to-video
نصّ النموذج في الواجهةMiniMax-M3MiniMax-H3
النقطة الطرفية/v1/chat/completions/v2/video_generation
كيف تناديهمحادثة، تزامنيةأنشئ مهمة، واستعلم عن معرّفها، ثم اجلب الملف
الفوترةبالرموزبثواني الإخراج
ماذا يعودنصّملف MP4

ووسم خطّ الإنتاج هو الطريق السريع. فهو حقل معلَن على مستودع النموذج، وهو يسمّي وسيط الخرج — ووسم M3 يقول نصّ. والنموذج الذي ينتهي وسم مهمّته بالمقطع -to-text لا سبيل له إلى ملف فيديو، مهما صيغ الطلب.

أما صفّ الفوترة فهو الذي يعضّ الفرق لا الأفراد. سعّر مشروعًا على النموذج الخطأ هنا فلا يكون التقدير مائلًا قليلًا، بل يكون بوحدة أخرى تمامًا — رموز مقابل ثواني إخراج — ولا شيء في المراحل التالية يوفّق بينهما.

غذِّ M3 بمقطع، وإليك ما يستطيع رؤيته فعلًا

يستحقّ المعرفة حتى لو كنت لا تصنع سوى الفيديو، فقد تبيّن أن M3 نافع في طريق الدخول.

M3 متعدّد الوسائط أصلًا: النصّ والصور والفيديو كلها تصل عبر نقطة المحادثة نفسها، مدرَّبة معًا من البداية لا عبر محوّل رؤية مركَّب فوق نموذج نصّي. وبطاقة النشر لدى NVIDIA تضع سقف المواد الطويلة عند نحو 30 دقيقة من اللقطات لكل طلب، وتُعلن MiniMax نتيجة 84.6 على Video-MME عند 512 إطارًا — وهو تقييمها هي، فاقرأه بوصفه معلَنًا من المزوّد.

وثلاثة أمور أهمّ من تلك النتيجة.

الفيديو يدخل إطارات، لا ملفًا. أنت تأخذ عيّنات من المقطع وتمرّر تسلسلًا مرتَّبًا من الصور. وتقييم MiniMax المنشور نفسه أخذ العيّنات عند 1 إطار في الثانية.

وهذا يجعل السقف ميزانية رموز مرتديةً زيّ مدة زمنية. فكل إطار تأخذه عيّنةً ينفق جزءًا من نافذة السياق البالغة 1,048,576 رمزًا. ولهذا يظهر الحدّ بالدقائق على صفحة نشر وبالإطارات في تهيئة تقييم: إذ إن 512 إطارًا عند إطار واحد في الثانية تساوي نحو ثماني دقائق ونصف من لقطات حقيقية. ونصف الساعة نصف ساعة فقط إن قبلت أن تنظر إليها بإطار واحد في الثانية — خذ عيّنة من دقيقتين عند 12 إطارًا في الثانية فتكون أنفقت الميزانية نفسها على جزء من اثني عشر من زمن التشغيل. اضبط معدّل عيّناتك على اللقطة، لا على طول الملف.

وM3 لا يستطيع سماع مقطعك. فمسار الفيديو تسلسل من الصور الثابتة، والمسار الصوتي لا يسافر معها. والدليل في تهيئة Video-MME لدى MiniMax نفسها، إذ أدخلت الترجمة النصّية بوصفها نصًّا كل 30 ثانية بدل تغذية الصوت. فأي شيء يقوله M3 عن الحوار أو الموسيقى أو طنين الغرفة فقد استنتجه من الصور وممّا سلّمته إليه من نصّ. فإن كان الحوار مهمًّا، فالصق نصًّا منسوخًا.

وهذا يترك انعكاسًا أنيقًا تتذكّر به الثنائي: H3 يعرّفه الصوت الذي ينتجه، وM3 يعرّفه الصوت الذي لا يستطيع استقباله. الشركة نفسها، وشهران بينهما.

وإن كان وصف لقطات تملكها أصلًا هو المهمة الحقيقية، فإن أداة استخراج البرومبت من الفيديو عندنا تقدّم النسخة المصمّمة على مقاس H3: تقرأ مقطعًا وتعيد برومبتًا منظَّمًا تُخرج منه مباشرة، بدل نثر تضطرّ بعدها إلى تحويله يدويًا.

أربعة أسماء تجيب اليوم على «MiniMax 3»

الاسم الذي رأيتهما هوهل يصنع فيديو؟
MiniMax H3نموذج الفيديو. نصّ وصور وفيديو وصوت دخلًا؛ ومن 4 إلى 15 ثانية خرجًا، حتى 2Kنعم
MiniMax H3 Maxنسخة H3 المدرَّبة لاحقًا لدى fal — أسرع، بسقف 768p، ونقطتان طرفيتاننعم، بسقف أدنى
MiniMax M3نموذج النصّ والبرمجة والوكلاء. يقرأ الفيديو ويكتب نصًّالا
Music-3.0نموذج الموسيقى لدى MiniMaxلا

ثلاثة منتجات في اسمها الرقم 3 صدرت في 2026، ونصّا الواجهة لاثنين منها يفترقان بحرف واحد، وتبيع MiniMax نافذة M3 المليونية على أساس «فهم الفيديو الطويل» — وهو وصف دقيق، ولا يكاد يُميَّز عن توليد الفيديو للوهلة الأولى.

وH3 Max هو أحدث طريقة للهبوط في المكان الخطأ. هو نموذج حقيقي معتمَد من MiniMax، مدرَج بجوار H3 في توثيق MiniMax نفسها، لكنه ليس نموذجًا تبدّله بحرّية: مستضاف فقط، وبلا أوزان منشورة، وبدقة 768p لا 2K. ماذا يعظّم «Max» فعلًا، وماذا يتنازل عنه يمشي في المقايضة كلها.

أي نموذج تحتاجه مهمّتك

ما الذي يجب أن يخرجالنموذجأين
فيديو، بصوت، من فكرة مكتوبةMiniMax H3تحويل النص إلى فيديو
فيديو يبدأ من صورة لديكMiniMax H3تحويل الصورة إلى فيديو
فيديو يحافظ على شخصية أو صوت أو أسلوب عبر القطعاتMiniMax H3من صورة مرجعية إلى فيديو
برومبت أو وصف من لقطات تملكها أصلًاأيّهمااستخراج البرومبت من الفيديو
نصّ أو شيفرة أو وكيل أو قراءة سياق طويلMiniMax M3صفحات M3 لدى MiniMax نفسها

دع M3 يكتب البرومبت، ودع H3 يخرجه

لدى M3 مهمة في خطّ إنتاج الفيديو فعلًا. هي فقط ليست مهمة الإخراج.

H3 لا يريد جملة. يريد وصفًا طويلًا منظَّمًا — لقطة بلقطة، بحركات كاميرا وتوقيتات وصوت مكتوبة في حقول مسمّاة. وتبني MiniMax ذلك الوصف بمرحلة مستضافة اسمها Context-IR ليست في الإصدار المفتوح، وإرشاداتها هي نفسها تدعو المطوّرين إلى بناء معالجتهم الأولية بدلًا منها.

وM3 يملأ تلك الفجوة على نحو يكاد يكون مثاليًا. نافذة من مليون رمز تحمل دليل هوية علامة تجارية وقائمة لقطات في آنٍ واحد؛ ودخل الصور والفيديو الأصلي يعني أنه يستطيع قراءة موادّك المرجعية؛ وهو يُخرج نصًّا، وهو بالضبط ما يستهلكه H3. فخطّ الإنتاج إذن: M3 يكتب البرومبت، وH3 يخرجه — والبحث الذي جاء بك إلى هنا كان على بُعد حرف واحد من سير عمل حقيقي، لا خطأً.

والتسليم الكامل — برومبت النظام الذي يجعل M3 يُخرج صيغة الحقول الثلاثة الخاصة بنموذج H3، وكم يكلّف التبادل مقابل الإخراج، وأين تفترق الرخصتان — موجود في MiniMax H3 مقابل MiniMax M3. ولتخطّي بنائه بنفسك، مولد البرومبت عندنا ينتج البنية نفسها في المتصفح.

MiniMax M3 والفيديو: أسئلة شائعة

هل MiniMax M3 نموذج فيديو؟ هو نموذج متعدّد الوسائط يقرأ الفيديو. وليس نموذج توليد فيديو — فوسم خطّ إنتاجه هو image-text-to-text.

هل يستطيع MiniMax M3 التحويل من نصّ إلى فيديو؟ لا. H3 يستطيع، وهو النموذج الذي بنته MiniMax لذلك.

ما هذا «مولد فيديو MiniMax M3» الذي أراه معلَنًا باستمرار؟ هو في الغالب واجهة على MiniMax H3 تستخدم كتابة M3 لالتقاط هذا البحث. المولد حقيقي؛ واسم النموذج المكتوب عليه خطأ.

هل H3 Max هو M3 نفسه؟ لا، وهذان أسهل ثنائي يُبدَّل بالخطأ. H3 Max يصنع فيديو وهو نسخة من H3 مدرَّبة لاحقًا؛ وM3 يصنع نصًّا. والحرف المشترك مصادفة.

هل يفهم M3 الصوت في مقطع أرفعه؟ لا. الإطارات تدخل، والمسار الصوتي لا يدخل. الصق نصًّا منسوخًا حين يكون الحوار مهمًّا.

كم عدد معاملات MiniMax M3؟ نحو 428 مليارًا إجمالًا، ونحو 23 مليارًا نشطة لكل رمز، عبر 128 خبيرًا مع أربعة مفعَّلة لكل رمز. وبيانات safetensors الوصفية على Hugging Face تذكر 427,040,140,160 بالضبط.

هل MiniMax M3 وMiniMax H3 كلاهما مفتوح الأوزان؟ كلاهما ينشر أوزانًا برخص مقيَّدة ليست مصدرًا مفتوحًا بمعيار OSI، والقيود تختلف في شكلها — M3 بلا حدّ جغرافي، وH3 يستثني أربعة أسواق. ما الذي يقيّده ترخيص H3 فعلًا يفكّك ذلك الجانب.

أريد فقط أن أصنع فيديو. ابدأ من تحويل النص إلى فيديو على MiniMax H3 — بلا حاجة إلى M3، والصوت يصل في التمريرة نفسها.


آخر تحقّق 31 أغسطس 2026. سقف الثلاثين دقيقة رقم نشر منشور من NVIDIA لا ضمانًا من واجهة MiniMax البرمجية، ونتيجة Video-MME من MiniMax نفسها — والاثنان موثّقا المصدر لتتمكّن من إعادة فحصهما بدل أخذهما على عهدة أحد. وMiniMax تُطلق بسرعة تكفي لأن يكون «3» رابع احتمالًا قائمًا.

هيئة التحرير

بقلم

هيئة التحرير

minimax-h3ai.video

نُشر في مولد فيديو MiniMax H3 بالذكاء الاصطناعي، وهو واجهة مستقلة من طرف ثالث مبنية على MiniMax H3.

كل المقالات