مژگان عروجی
4 یادداشت منتشر شدهپلتفرم های مدیریت داده های پژوهشی
پلتفرم ها
۱. Zenodo [1]
یک مخزن داده باز، چندرشته ای و رایگان است که توسط آزمایشگاه سرن[2]و با پشتیبانی کمیسیون اروپا از طریق پروژه Open AIRE اداره می شود. این پلتفرم در می ۲۰۱۳ شروع به کار کرد و بر مبنای نرم افزار متن باز ساخته شده است. هدف اصلی آن فراهم کردن فضای مرکزی، پایدار، قابل اعتبار و رایگان برای اشتراک گذاری، انتشار و حفظ داده های پژوهشی در تمام رشته ها از فیزیک و نجوم تا علوم انسانی است.
مزایا:
- اختصاص DOI به هر بارگذاری: هر رکورد منتشر شده اختصاص یک شناسه پایدار دیجیتال[3] پیدا می کند. یعنی DOI مختص هر نسخه و البته عمومی برای همه نسخه ها ثبت می شود.
- نحوه تعامل با گیت هاب[4]: اتصال مستقیم به گیت هاب ها امکان دهی خودکار از ریلیس های[5] نرم افزار را فراهم می کند که برای مستندات کد و نرم افزارهای پژوهشی بسیار مفید است.
- محدودیت حجم تا ۵۰ گیگابایت برای هر رکورد: امکان اجرای داده های بزرگ تر.
- هماهنگی با اصول FAIR: تلاش می شود داده ها قابل کشف و قابل دسترسی باشند. فراداده در قالب استانداردهای DataCite و Dublin Core صادر می شود.
- ثبت در سه حالت دسترسی: داده ها را می توان به صورت باز، بسته یا به صورت مهلت محدودسازی دسترسی[6] منتشر کرد.
وضعیت برای کاربران ایرانی
از نظر سیاست های اعلامی، Zenodo دسترسی آزاد برای کاربران همه کشورها دارد و تحریم جغرافیایی خاصی علیه کاربران عادی ایرانی اعمال نکرده است. قوانین استفاده این پلتفرم تنها محدودیت های بار ترافیکی، معدل درخواست و جلوگیری از کاربردهای نظامی را تعیین می کند. با این حال، باید در نظر داشت که به دلیل شرایط تحریمی مالی بین المللی علیه ایران، برخی کارکردهای وابسته به پرداخت ها یا سرویس های شخص ثالث ممکن است برای کاربران مستقر در ایران محدود شود. برای موارد عادی مانند ثبت نام و بارگذاری داده های پژوهشی، عملا دسترسی امکانپذیر است.
۲. Dataverse[7]
یک نرم افزار متن باز برای انتشار، استناد، کشف و حفظ داده های پژوهشی است. توسط موسسه علوم اجتماعی کمی[8]در دانشگاه هاروارد به همراه یک جامعه جهانی توسعه دهندگان ساخته شده است. در مورد Dataverse باید گفت که بعد از نصب، یک زیرساخت محلی ایجاد می شود که هر دانشگاه، موسسه یا حتی آزمایشگاه می تواند آن را برای خودش اجرا کند و بر روی داده ها حاکمیت مستقل داشته باشد.
مزایا:
- ساختار سلسله مراتبی: مفهومی است که یک مجموعه می تواند دیتاست ها و زیرمجموعه ها را در بر بگیرد. هر بخش را می توان با برند و تنظیمات خاص خودشان مدیریت کرد. این ویژگی برای جوامع بزرگ که بخش های مختلف دارند بسیار مناسب است.
- اختصاص DOI: اختصاص شناسه پایدار و ایجاد استناد علمی استاندارد بر مبنای اصول جاری.
- فراداده غنی و سفارشی[9]: همانند DDI (برای علوم اجتماعی) و جغرافیایی و نجوم.
- مدیریت دقیق دسترسی ها: کنترل سطح دسترسی (مدیر، متصدی، همکار، دانلودار فایل) در سطح مجموعه محیاست.
وضعیت برای کاربران ایرانی
نرم افزار Dataverse متن باز است و هیچ تحریمی بر آن اعمال نشده است. در واقع، یکی از جذاب ترین ویژگی ها برای موسسات ایرانی این است که می توانند یک نمونه محلی Dataverse را روی سرورهای خودشان نصب کنند و به طور کامل از آن مانند یک زیرساخت بومی استفاده کنند.
۳. Figshare [10]
یک مخزن داده ابری عمومی است که به خصوص برای محققان منفرد طراحی شده و در گروه Digital Science قرار دارد. این پلتفرم به کاربران اجازه می دهد هر نوع محصول پژوهشی اعم از داده، شکل، کد، مقاله، پایان نامه، ارائه را در یک فضا ابری به اشتراک بگذارند و به آن DOI اختصاص دهند.
مزایا:
- سقف رایگان ۲۰ گیگا بایت برای هر محقق: فایل های تکی تا سقف ۲۰ گیگا بایت را می توان بارگذاری کرد و تا ۲۰ گیگا بایت ذخیره رایگان در اختیار هر کاربر قرار می گیرد.
- اختصاص DOI برای هر آیتم: هر رکورد منتشر شده استنادپذیر و قابل پیگیری می شود. نسخه بندی فایل ها پشتیبانی می شود.
- استناد به ORCID: آیتم ها به صورت خودکار به پروفایل ORCID کاربر منتقل می شوند.
- نمایش فرمت های متنوع: هر نوع فرمت فایل پذیرفته می شود و پیش نمایش مرورگر ارائه می شود.
- API عمومی: اجازه بارگذاری و جستجوی برنامه نویسی از طریق https://docs.figshare.com.
- حفظ بلندمدت: محتوای اسناد توسط یک شبکه حفظ دیجیتال[11] پشتیبانی می شود.
البته نکته قابل ذکر درخصوص Figshare این است که محتوای عمومی آن در دسترس همه کاربران است و می توانند هر چیز را بارگذاری کنند و کیفیت محتوا به صورت خودکار راستی آزمایی نمی شود.
وضعیت برای کاربران ایرانی
دسترسی عمومی به فایل های دسترسی آزاد و مرور دیتاست ها برای کاربران ایرانی در دسترس است. اما نکته مهم این است که برای سرویس های سازمانی[12]یا سرویس های نیازمند پرداخت[13]، به دلیل تحریم های مالی و قراردادهایی با میزبانی های ابری آمریکایی (مانند AWS)، محدودیت های جدی وجود دارد. حساب رایگان فردی از نظر فنی قابل استفاده است.
۴. OSF (Open Science Framework) [14]
OSF یک پلتفرم متن باز و رایگان برای همکاری و بازتولیدپذیری پژوهش در کل چرخه ی زندگی تحقیق است. توسط سازمان غیرانتفاعی [15](COS) توسعه داده شده است. ویژگی متمایز OSF این است که به شکل یک ایستگاه مرکزی در تحقیقات عمل می کند، یعنی به جای اینکه خودتان یک مخزن مجزا داشته باشید، روی فضای ابری و مخازن شخص ثالث مثلGoogle Drive، GitHub، Dataverse و… به صورت ایجاد لینک اتصال می گیرد و همه را در یک پروژه یکپارچه با کنترل نسخه و افراد به هم مرتبط می کند.
مزایا:
- مدیریت چرخه زندگی کامل تحقیق: از مرحله تدوین و ثبت اولیه تا انتشار نسخه همراه است.
- کنترل نسخه و مدیریت فایل: فضای OSF Storage به طور خودکار نسخه بندی فایل ها را با ثبت زمان و تاریخچه تغییرات نگه می دارد.
- اتصال به ابزارهای بیرونی: قابلیت اتصال به سرورها، سایت ها و مخازن داده دیگر را دارد.
- ویکی های پروژه: برای مستندات آزمایشگاهی و چک لیست ها پژوهشی پشتیبانی پایتون دارد.
- اختصاص DOI برای خروجی های عمومی.
وضعیت برای کاربران ایرانی
OSF به عنوان نهاد غیر انتفاعی آمریکایی مشمول قوانین تحریمی وزارت خزانه داری آمریکا[16]است. با این وجود، تبادلات آزاد علمی و محتوای باز از یک استثناء خاص بهره مند هستند، بنابراین دسترسی به محتواهای باز و پیش نویس ها برای کاربران ایرانی مجاز است. اما خدماتی که به سرویس های تجاری متصل باشند، ممکن است برای کاربران مستقر در ایران محدود شود. ثبت حساب رایگان و استفاده از سرویس های عمومی عملا در دسترس است.
بر اساس جدیدترین اطلاعیه های اخیر COS، این پلتفرم در حال تغییر به یک ساختار «چرخه زندگی» باز است که (ثبت ها، پری پرینت ها و آرشیو پایدار) قابلیت ساخت پروژه های کاری عمومی جدید را شامل می شوند.
۵. Hugging Face [17]
یک پلتفرم ابری و «گیت هاب دنیای هوش مصنوعی» است که سه رکن اصلی را در کنار هم نگه می دارد. مخزن بزرگ مدل های از پیش آموزش دیده شده، مجموعه عظیمی از دیتاست ها و بسترهای برای میزبانی و اجرای برنامه های کاربردی هوش مصنوعی. این پلتفرم به ویژه در توسعه ی یادگیری ماشین و مدل های زبانی بزرگ استاندارد جهانی نقش روشنی دارد.
مزایا:
- مخزن عظیم مدل و دیتاست: صدها هزار مدل و دیتاست از پیش طراحی شده در آن موجود است که از کد منبع های مختلف بارگذاری شده است.
- کنترل نسخه: هر مدل یا دیتاست می تواند دنباله نسخه ها و تاریخچه قبول تغییرات خودش را نگه دارد.
- Spaces برای نمایش زنده ابزارها: برنامه های کاربردی که کاربران می توانند خروجی مدل ها را به صورت تعاملی تست کنند.
- API عمومی: اجازه اجرای مدل ها بدون نصب.
وضعیت برای کاربران ایرانی
پلتفرم Hugging Face مشمول مقررات کنترل صادرات آمریکا قرار دارد. مدل هایی مانند خانواده Meta Llama که دارای لایسنس محدود هستند، برای آی پی های مناطق تحت تحریم جامع از جمله ایران مسدود هستند یا نیازمند احراز هویت خارج از حوزه تحریم می باشند. سرویس های پولی و ابری به دلیل تحریم های پرداختی و بانکی آمریکا برای کاربران عادی داخل ایران در دسترس مستقیم نیست. بخش های عمومی و متن باز که مرور و دانلود مدل ها و دیتاست های عمومی در بسیاری موارد ممکن است اما ممکن است با خطای اختلال IP مواجه شود و به وضعیت شبکه خاص کاربر بستگی دارد. در نتیجه می توان گفت این پلتفرم برای کاربر ایرانی، به عنوان منبع داده و مدل، قابل استفاده است اما استفاده از تمام امکاناتش به وضعیت شبکه، نوع حساب و نوع سرویس بستگی دارد.
در یادداشت بعدی به «آماده سازی فایل برای آپلود» می پردازیم.
[1] - https://zenodo.org
[2] - CERN
[3] - DOI
[4] - GitHu
[5] - Release
[6] - Embargo
[7] - https://dataverse.org
[8] - IQSS
[9] - Custom Metadata Blocks
[10] - https://figshare.com
[11] - CLOCKSS
[12] - Figshare for Institutions
[13] - Figshare Plus
[14] - https://osf.io
[15] - Center for Open Science
[16]- OFAC
[17] - https://huggingface.co