لدي ساعات من تسجيلات المقابلات والاجتماعات التي أحتاج لتحويلها إلى نص. Otter والخدمات المشابهة تفرض قيوداً قاسية على النسخة المجانية وتسعير الدقيقة الواحدة يتراكم بسرعة. هل هناك طريقة مجانية حقاً لتحويل التسجيلات الطويلة إلى نص في سنة 2026، حتى لو استغرقت جهداً أكثر؟
نعم — وللمرة الأولى، الخيار المجاني هو أيضاً الخيار الأفضل:
Whisper (نموذج OpenAI مفتوح المصدر، يعمل على جهازك الشخصي). هذا هو الحل لـ “ساعات من التسجيلات، ميزانية صفر”:
- مجاني تماماً، بدون حدود، بدون رفع ملفات — الملف الصوتي لا يترك جهازك أبداً (غالباً ما يكون مطلوباً لأسباب أخلاقية في البحث العلمي والمقابلات).
- دقة النموذج على الكلام الواضح تساوي أو تتفوق على الخدمات المدفوعة، ويتعامل بشكل جيد مع اللهجات واللغات (~100 لغة).
- الطريقة الأسهل للاستخدام: تطبيق واجهة رسومية يغلف Whisper — مثلاً التطبيقات المكتبية المجانية المبنية على whisper.cpp (ابحث عن “whisper desktop app” لنظام التشغيل الخاص بك؛ MacWhisper النسخة المجانية على Mac هي الأكثر شهرة). اسحب ملف MP3 إليه، واحصل على النص مع الوقت.
- تقوم جهازك المحمول العادي بالنسخ بسرعة تقريباً مساوية للوقت الفعلي أو أسرع باستخدام النماذج الصغيرة/المتوسطة؛ المعالجات الليلية سهلة جداً.
طرق مجانية بدون تثبيت (احتياجات أخف):
- Google Recorder (هواتف Pixel): نسخ مباشر مجاني، بدقة مذهلة.
- حيلة YouTube: احرفع الملف الصوتي كفيديو غير مدرج → انتظر التسميات التوضيحية التلقائية → نزّل النص. غير عملي لكن مجاني وبدون حدود.
- نسخ Word / OneNote موجود لكن مرتبط باشتراكات Microsoft 365 — ليس مجاني فعلاً.
توقعات صحيحة: الاجتماعات التي يتحدث فيها 6 أشخاص مع تداخل كلام وميكروفون سيء ستُنتج نصاً فوضوياً من أي أداة، حتى المدفوعة منها. تسمية المتحدثين (“من قال ماذا”) هي حيث تكون الأدوات المجانية الأضعف — Whisper تحتاج إلى إضافة (تمييز المتحدثين) التي لا تزال معقدة. بالنسبة للمقابلات الفردية مع صوت جيد، نص Whisper المجاني نظيف تماماً.
نصيحة التنظيف: ألصق أجزاء النص الخام في روبوت دردشة ذكي مجاني — “أصلح أخطاء النسخ، أضف فقرات، لا تلخص” — قبل أن تبدأ في الاقتباس منه.
كيف يبدو الملف الصوتي — مقابلات فردية أم اجتماعات متعددة الأشخاص؟