سامانه اطلاعات پژوهشی ایران

این سایت در حال حاضر پشتیبانی نمی شود و امکان دارد داده های نشریات بروز نباشند

پنجشنبه 27 آذر 1404


پردازش علائم و داده ها، جلد ۱۱، شماره ۱، صفحات ۱۰۷-۱۱۵


عنوان فارسی	بازشناسی متون فارسی با استفاده از مدل زبانی n-gram و پالایش گرامری

چکیده فارسی مقاله	بازشناسی متون، در سال‌های اخیر بسیار مورد توجه قرار گرفته است. ارائه الگوریتم‌های بازشناسی برگرفته از ساختار گرامری و معنایی این زبان می‌تواند روش موثری در پردازش‌های دیگر مربوط به خط و زبان فارسی باشد. در این مقاله با استفاده از شاخه علمی پردازش زبان-های طبیعی، یک الگوریتم سه مرحله‌ای به منظور بازشناسی متون فارسی بر مبنای بازشناسی جملات فارسی ارائه می‌شود. این روش شامل مراحل ترکیب زیرکلمات به منظور ساخت کلمات و سپس جملات بالقوه معنی‌دار و در نهایت استفاده از دو مدل زبانی و چند قاعده گرامری به منظور تشخیص جمله صحیح براساس انطباق با گرامر زبان فارسی می‌باشد. آزمایشات متعدد نشان می‌دهد که دقت روش ارائه شده برای مرحله ساخت کلمات و سپس جملات بالقوه معنی‌دار 98 درصد و 85 درصد برای تشخیص جمله صحیح با استفاده از مدل زبانی بایگرام و 88 درصد برای مدل زبانی ترایگرام است.

کلیدواژه‌های فارسی مقاله

عنوان انگلیسی	Persian Text Recognition using n-gram Language Models and Grammatical Refinement

چکیده انگلیسی مقاله	Abstract Text recognition has been one of the growing research topics in recent years. Many of these researches have focused on recognition of letters and sub-words as a basis for identifying larger text structures such as words, phrases and sentences. This thesis presents a new method in which the recognized sub-words are combined in order to provide meaningful words and sentences in Farsi texts. Since there may be more than one meaningful combination, the potential meaningful sentences are filtered using Farsi grammatical rules. In the sub-word recognition stage, a double scan method is exploited while the words are extracted using a database of frequent Farsi words. In the last stage a 2 and 3-gram method as well as Farsi grammatical rules are employed to identify the most meaningful sentence from all potential candidates. Experiments have proved the accuracy of the exploited method to be more than 85 percent. Keywords: Text recognition, Persian, Persian language modeling, Natural language processing

کلیدواژه‌های انگلیسی مقاله

نویسندگان مقاله	پریسا شیروانی \| parisa shirvani مهرداد وطن خواه خوزانی \| mehrdad vatankhah khouzani خشایار یغمایی \| khashayar yaghmaie

نشانی اینترنتی	http://jsdp.rcisp.ac.ir/browse.php?a_code=A-10-355-1&slc_lang=fa&sid=fa
فایل مقاله	اشکال در دسترسی به فایل - ./files/site1/rds_journals/1315/article-1315-233383.pdf
کد مقاله (doi)
زبان مقاله منتشر شده	fa
موضوعات مقاله منتشر شده	مقالات پردازش متن
نوع مقاله منتشر شده	پژوهشی

برگشت به: صفحه اول پایگاه \| نسخه مرتبط \| نشریه مرتبط \| فهرست نشریات

ارسال پیام برخط

در صورت مشاهده هر نوع اشکال در داده های پایگاه و یا برای ارسال نظرات و پیشنهاد های خود می توانید با پر کردن فرم تماس ما را در جریان قرار دهید.
برای پر کردن فرم تماس اینجا را کلیک کنید.

آمار پایگاه

نمایه شده در ISI 135

نمایه شده در PubMed 109

نمایه شده در Scopus 192

کاربران برخط 401

بازدید امروز 41062

بازدید کل 39421961

اطلاعات تماس

آدرس : تهران، سعادت آباد، بلوار پاکنژاد شمالی، بالاتر از میدان سرو، نبش کوچه ندا، پلاک ۶۸، ساختمان جاوید، واحد ۱۶

پست الکترونیک: yektaweb-AT-gmail.com

توجه

کلیه حقوق این وب سایت و مطالب آن متعلق به شرکت یکتاوب بوده و استفاده از مطالب آن با ذکر منبع بلامانع است
طراحی و برنامه نویسی: یکتاوب افزار شرق