یک روش جدید برای استخراج کلمات و عبارات کلیدی تک سنده فارسی با استفاده از تعیین حدود جمله

  • سال انتشار: 1387
  • محل انتشار: دومین کنگره مشترک سیستمهای فازی و هوشمند ایران
  • کد COI اختصاصی: FJCFIS02_336
  • زبان مقاله: فارسی
  • تعداد مشاهده: 1047
دانلود فایل این مقاله

نویسندگان

مجید ابرانپور

دانشکده مهندسی کامپیوتر دانشگاه علم و صنعت ایران تهران

بهروز مینایی بیدگلی

چکیده

در این مقاله، از یک روش جدید برای استخراج واژههای کلیدی سند فارسی استفاده شده است. ویژگیهای آماری برای واژههای مختلف محاسبه شده و با استفاده از اعمال قواعد، واژههای کلیدی محتمل، انتخاب میشوند. گام بعدی محاسبه رخداد همزمان (co-occurrence)پیشین و پسین واژههای کلیدی محتمل، با واژههای تکرار شونده در جملات سند است. با استفاده از این روش بر خلاف اکثر روشهای آماری که فقط واژههای کلیدی یک واژهای را استخراج میکنند، واژههای کلیدی بیش از یک واژهای نیز استخراج میشوند. استفاده از روش رخداد همزمان بهبود خوبی را نشان میدهد و واژههای کلیدی بامعنی پیشنهاد میکند. عمل حذف واژههایعمومیstopwords) که به عنوان پیشپردازش روی اسناد انجام میشد در این روش بصورت پسپردازش انجام شده که واژههای کلیدیچتد واژهای نیز بدست آیند

کلیدواژه ها

استخراج کلمات کلیدی، تعیین حدود جمله، رخداد همزمان، کلمات چند بخشی

مقالات مرتبط جدید

اطلاعات بیشتر در مورد COI

COI مخفف عبارت CIVILICA Object Identifier به معنی شناسه سیویلیکا برای اسناد است. COI کدی است که مطابق محل انتشار، به مقالات کنفرانسها و ژورنالهای داخل کشور به هنگام نمایه سازی بر روی پایگاه استنادی سیویلیکا اختصاص می یابد.

کد COI به مفهوم کد ملی اسناد نمایه شده در سیویلیکا است و کدی یکتا و ثابت است و به همین دلیل همواره قابلیت استناد و پیگیری دارد.