تصلني كثير من الأسئلة حول كيفية البقاء على اطلاع بأحدث التطورات في مجال الذكاء الاصطناعي والأوراق البحثية الخاصة بالمجال
اذا كنت عالم بيانات أو مهندس ذكاء اصطناعي او مهتم بشكل عام بالمجال أنصح بمتابعة صفحة الابحاث وتطورات الـ AI من Hugging Face من @_akhaliq
حيث يتم تحديثها يوميا بأحدث الأبحاث في الذكاء الاصطناعي والتعلم الآلي لجميع انواع النماذج والبيانات (الصور، فيديوهات، نصوص، اصوات)
المميز في الصفحة أنها تحتوي على نظام تصنيف يعتمد على تفاعل المجتمع، بحيث يتم التصويت على الأوراق والابحاث التي يرونها مفيدة او مؤثرة، مما يبرز أهم الأوراق وأكثرها تأثيرًا وتلخيص اهم الابحاث.
مصدر رائع ومفيد جدًا للباحثين والمهتمين في المجال:
https://t.co/CQp5lA2k4l
في أضخم حدث وطني لخدمة اللغة العربية.. بدء منافسات المرحلة النهائية لمنافسات "#تحدّي_علاّم" بمشاركة 17 دولة بمدينة الرياض.
https://t.co/7TXZTjtjJz
#واس_عام
بالفترة الماضية نشرت Google بالشراكة مع عدة جامعات ورقة علمية باسم Spider2-V والهدف منها دراسة امكانية نماذج الذكاء الاصطناعي لاتمتة المهام وخصوصا في هندسة البيانات وعلوم البيانات
تم بناء Spider2-V كأول معيار قياس متعدد الوسائط لهذه المهام، بحيث يمكنه تنفيذ مهام تتضمن كتابة كود SQL، كود Python، وإدارة واجهات التطبيقات (مذكور في الورقة)
تم اختبار النموذج على اكثر من 490 مهمة واقعية باستخدام تطبيقات مهنية متقدمة، ومع ذلك أظهرت النتائج نجاحًا بنسبة 14% من GPT-4.
البيانات التي بالورقة تتوزع مابين Jupyter Lab, Excel, Airflow, SQL, Snowflake, Big Query ويوجد المزيد مذكور في الورقة
تعد هذه الورقة خطوة تساعد المجال لتطوير وكلاء او نماذج ذكاء اصطناعي أكثر كفاءة ودقة، وسيساهم في زيادة الإنتاجية وتسريع الابتكارات المستقبلية في مجالات علوم البيانات والهندسة وخصوصا تسريع وتحسين اداء المهام من المهندسين وعلماء البيانات مستقبلا.
رابط الورقة:
https://t.co/Lw5diwvlrZ
المدونة:
https://t.co/pY28guF8h4
من اسباب نجاح نماذج الذكاء الاصطناعي الحديثة مثل ChatGPT او Llama 3 وتقدم الثورة في تقنيات التعلم الآلي وعلم البيانات هي خوارزمية ونموذج Transformers المقدمة من Google عام 2017 ولكن فهمها يظل صعباً للكثيرين ولذلك قدم فريق من الباحثين اداة "Transformer Explainer" وهي أداة تفاعلية ومرئية مصممة لغير المختصين او المبتدئين بمجال الذكاء الاصطناعي لتعلم كيفية عمل نموذج وهيكلة Transformers من خلال نموذج GPT-2 على سبيل المثال
تساعد هذه الأداة على فهم مفاهيم Transformers المعقدة من خلال توفير نظرة عامة على النموذج وتسهيل التنقل بين مستويات مختلفة داخل هيكلة النموذج.
تعمل الأداة مباشرة في ال متصفح ، مما يمكن تجربة مدخلاته الخاصة ومشاهدة عمل مكونات النموذج بالوقت الفعلي.
الأداة متاحة مجانًا ولا تحتاج إلى تثبيت أو معدات خاصة، مما يوسع نطاق التعليم العام لتقنيات الذكاء الاصطناعي الحديثة.
انصح بالاطلاع عليها وتجربتها لفهم أعمق لـ Transformers
رابط الأداة:
https://t.co/OF5xas2lE3
أكثر خبر انتشاراً بمجتمع الذكاء الاصطناعي كان بالأمس عندما أعلنت ميتا عن إطلاق نموذج مفتوح المصدر باسم Segment Anything 2 (SAM 2)
وهو آخر ابتكاراتها في تقنيات الذكاء الاصطناعي والرؤية الحاسوبية لتحليل الصور والفيديوهات. وهو أول نموذج موحد لتقسيم الأجسام في الصور والفيديوهات (Image Segmentation) بالوقت الفعلي وبشكل فوري ودقيق
يمكنه أيضًا تقسيم أي جسم في أي فيديو أو صورة، مما يسمح بتطبيقه على محتوى بصري غير مألوف او غير مدرب عليه دون الحاجة لتعديلات مخصصة (Zero-Shot)
النموذج تم تدريبه من قبل على 11 مليون صورة واكثر من مليار قناع للصور (Mask) واكثر من 51 الف فيديو مع توسميته الخاصة
النموذج يفتح ابوابا جديدة للتطبيقات العملية في مختلف المجالات مثل الامن والسلامة والقطاعات العسكرية, الطب, صور الاقمار الصناعية, علم الفضاء وتسمية البيانات (Data Annotation) وبالفعل الكثير من الشركات استخدموه وتم توفير الملايين من الساعات وايضا النموذج تم تطبيقه داخل منصة Instagram في تعديل الصور وقصها
ميتا شاركت الاكواد البرمجية والنموذج المدرب واوزانه كاملة بشكل مفتوح في منصة GitHub
بالإضافة إلى ذلك، تم إصدار مجموعة البيانات SA-V، التي تحتوي على:
- حوالي 51 ألف فيديو واقعي مع أكثر من 600 ألف قناع (Masked)
- عدد تعليقات أكثر بـ 53 مرة من أكبر مجموعات بيانات تقسيم الفيديو المتوفرة حاليا
النموذج والورقة العلمية لـ SAM 2 رائعة وتعد من النماذج الرائدة في مجال تقسيم الصور والفيديو. أنصح بقراءة الورقة واستكشاف النموذج لمعرفة إمكانياته الكبيرة:
رابط الورقة العلمية: https://t.co/c8ZFfXyOoP
المقالة: https://t.co/Y9N3uzLMSm
الأكواد: https://t.co/pznQFPAGj8
البيانات: https://t.co/19wjkydN3o
لتجربة النموذج: https://t.co/Q3sPTwOXwK
6 ممارسات من أفضل الممارسات للتعامل مع #البيانات :
1- تحديد البيانات الحرجة (المهمة)
2- بناء سياسات وإجراءات لإدارة البيانات
3- إشراك أصحاب المصلحة في عمليات حوكمة البيانات
4- عدم إهمال إدارة البيانات الرئيسية
5- عدم وضع قيود زائدة على البيانات
6- التعامل مع البيانات كأصول
أكثر مهارة مطلوبة هذه الفترة من علماء البيانات ومهندسين الذكاء الاصطناعي هي بناء حلول باستخدام التوليد المعزز بالاسترجاع، المعروفة باسم:
RAG (Retrieval Augmented Generation)
تقنية RAG أثبتت فعاليتها في إدخال المعلومات الحديثة، تقليل الهلوسة، وتحسين جودة الإجابات، خصوصاً في المجالات المتخصصة. تواجه هذه التقنية تحديات مثل التعقيد في التنفيذ وطول أوقات الاستجابة.u
واشارك معكم هذا البحث الجديد (انصح بالاطلاع عليه) الذي استكشف فيه الباحثون عن استراتيجيات فعالة لتوظيف RAG داخل جهات العمل بما يحقق التوازن بين الأداء والكفاءة وتحسين قدرات الإجابة عن الأسئلة بصورة سريعة ومتعددة الوسائط.
امثلة على الاستراتيجيات المذكورة:
- تقسيم البيانات
- عينة من البيانات وحجمها
- نوع قاعدة بيانات التضمين (Embeddings DB)
- تصنيف الاوامر
- استراتيجيات استرجاع البيانات
رابط الورقة العلمية:
https://t.co/b7e1qHkv2q
الحمد لله على التمام والتيسير 🤍
أكملت ولله الحمد مسار التحليل المالي ضمن البرامج التي قدمتها جامعة القصيم عبر منصة
FutureX
ومنصة edx بالتعاون مع كلية BABSON
كانت ايام جميلة استفدنا منها كثيراً 🤍
شكرا جامعة القصيم على تقديم مثل هذه البرامج واتاحة الفرصة للطلاب للتطوير والتعلم
ورقة علمية نُشرت اليوم وأصبحت محور الحديث في المجتمع بعنوان
"توسيع نطاق توليد البيانات الاصطناعية بـ 1,000,000,000 شخصية"
من قبل مختبر Tencent AI الورقة تقدم طريقة جديدة لتوليد بيانات تعتمد على شخصيات متنوعة داخل النماذج اللغوية الكبيرة (LLM) لإنشاء بيانات اصطناعية متنوعة بأسم "Persona Hub" وهي مجموعة تضم مليار شخصية متنوعة وتشكل حوالي 13% من إجمالي سكان العالم ومستخرجة تلقائيا من البيانات التي موجوده في الانترنت، لاستخدامها في توليد بيانات عالية الجودة في عدة قطاعات (تعليمية, مالية, صحية, اكاديمية, ادبية, تقنية, الخ..) وغيرها من السيناريوهات
ويتم الاستفادة من البيانات المولدة في انها توفر موارد تعليمية متنوعة لنماذج الذكاء الاصطناعي (pre-training, fine-tuning, etc..) وتساهم في تحسين البحث والتطوير في مجال النماذج اللغوية الكبيرة.
التفاصيل في الورقة:
https://t.co/oajyZvrpEG