یک روش جدید برای استخراج کلمات و عبارات کلیدی تک سنده فارسی با استفاده از تعیین حدود جمله
- سال انتشار: 1387
- محل انتشار: دومین کنگره مشترک سیستمهای فازی و هوشمند ایران
- کد COI اختصاصی: FJCFIS02_336
- زبان مقاله: فارسی
- تعداد مشاهده: 1089
نویسندگان
دانشکده مهندسی کامپیوتر دانشگاه علم و صنعت ایران تهران
چکیده
در این مقاله، از یک روش جدید برای استخراج واژههای کلیدی سند فارسی استفاده شده است. ویژگیهای آماری برای واژههای مختلف محاسبه شده و با استفاده از اعمال قواعد، واژههای کلیدی محتمل، انتخاب میشوند. گام بعدی محاسبه رخداد همزمان (co-occurrence)پیشین و پسین واژههای کلیدی محتمل، با واژههای تکرار شونده در جملات سند است. با استفاده از این روش بر خلاف اکثر روشهای آماری که فقط واژههای کلیدی یک واژهای را استخراج میکنند، واژههای کلیدی بیش از یک واژهای نیز استخراج میشوند. استفاده از روش رخداد همزمان بهبود خوبی را نشان میدهد و واژههای کلیدی بامعنی پیشنهاد میکند. عمل حذف واژههایعمومیstopwords) که به عنوان پیشپردازش روی اسناد انجام میشد در این روش بصورت پسپردازش انجام شده که واژههای کلیدیچتد واژهای نیز بدست آیندکلیدواژه ها
استخراج کلمات کلیدی، تعیین حدود جمله، رخداد همزمان، کلمات چند بخشیمقالات مرتبط جدید
- Artificial intelligence-based Diagnostic Approaches for Alzheimer's Disease Using Medical Imaging
- Artificial Intelligence-Based Telehealth Care in maternal health
- سیستم های هوش مصنوعی در پیشگیری و ارتقای سلامت عمومی
- Efficient Multi-Label Retinal Disease Classification with CLIP, LoRA, and Shadow Loss on the OIA-ODIR Dataset
- هوش مصنوعی در ژنتیک
اطلاعات بیشتر در مورد COI
COI مخفف عبارت CIVILICA Object Identifier به معنی شناسه سیویلیکا برای اسناد است. COI کدی است که مطابق محل انتشار، به مقالات کنفرانسها و ژورنالهای داخل کشور به هنگام نمایه سازی بر روی پایگاه استنادی سیویلیکا اختصاص می یابد.
کد COI به مفهوم کد ملی اسناد نمایه شده در سیویلیکا است و کدی یکتا و ثابت است و به همین دلیل همواره قابلیت استناد و پیگیری دارد.