سامانه اطلاعات پژوهشی ایران

این سایت در حال حاضر پشتیبانی نمی شود و امکان دارد داده های نشریات بروز نباشند

دوشنبه 24 آذر 1404


رایانش نرم و فناوری اطلاعات، جلد ۹، شماره ۳، صفحات ۱۰۹-۱۲۰


عنوان فارسی	ارائه فرایندی جهت یکپارچه‌سازی و تشخیص تکرار برای بهبود کیفیت داده‌ها

چکیده فارسی مقاله	اطلاعات در محیط‌ های کاری امروزی و تصمیم گیری‌ ها نقشی اساسی دارند. با توجه به اهمیت تصمیم گیری، اطمینان از کیفیت داده‌ های موجود ضروری است. با استفاده از روش‌ های پاک‌سازی داده می‌توان کیفیت داده‌ ها را بهبود بخشید. در این مقاله فرایندی در جهت کشف انواع رکورد های تکراری و متناقض، یکپارچه‌سازی و تشخیص تکرار برای بهبود کیفیت داده‌ها ارائه می‌شود. فرایند پیشنهادی شامل بخش‌هایی ازجمله کد کردن داده‌ها و خوشه‌بندی با استفاده از الگوریتم امید ریاضی- بیشینه‌سازی، ساخت نشانه برای رکوردها، ادغام روش‌های کدکردن داده‌ها و ساخت نشانه و ایجاد قوانین انجمنی با استفاده از الگوریتم Fp-growth است. نتایج آزمایش‌ها نشان می دهد در فرایند پیشنهادی به‌طور متوسط معیار فراخوانی 96%، صحت 99%، دقت 95% و امتیاز- اف 95% شده است. روش پیشنهادی با یک روش شناسایی تکرار و خطا، مقایسه شده است که نتایج حاصل نشان‌دهنده‌ی افزایش 13% فراخوانی، 1% صحت و 6% امتیاز- اف است.

کلیدواژه‌های فارسی مقاله	کیفیت داده‌، عوامل کیفیت داده‌ها، پاک‌سازی داده‌ها،

عنوان انگلیسی	Proposing a process to integrate and identify repetitions to improve the quality of data

چکیده انگلیسی مقاله	Recently, information in the workplace and decision has a major role. Due to the importance of deciding, it is also necessary to ensure data quality. Data quality can be improved by data cleaning methods. In this research, we propose a process for discovering duplications and contradictory types of records, integrating and identifying duplications to improve the quality of data. Our proposed process consists of different activities. These activities are coding records, clustering by expectation maximization algorithm, making token for records, integrate coding records methods and making token for records methods, and extracting association rules by Fp-growth Algorithm. The results of the tests show that the proposed process has averaged 96% recall, 99% precision, 95% accuracy and 95% f-score. The proposed method is compared with a duplication and error detection method. The results indicate an increase of 13% for recall, 1% for accuracy and 6% for f-score in the proposed process.

کلیدواژه‌های انگلیسی مقاله	کیفیت داده‌, عوامل کیفیت داده‌ها, پاک‌سازی داده‌ها

نویسندگان مقاله	نیلوفر ملامحمد \| دانشکده مهندسی برق و فناوری اطلاعات، واحد قزوین، دانشگاه آزاد اسلامی،قزوین، ایران. نگین دانشپور \| دانشکده مهندسی کامپیوتر، دانشگاه تربیت دبیر شهید رجایی، تهران، ایران.

نشانی اینترنتی	https://jscit.nit.ac.ir/article_107020_5cb9050b5d3b4e859caaa9314c3c8b96.pdf
فایل مقاله	فایلی برای مقاله ذخیره نشده است
کد مقاله (doi)
زبان مقاله منتشر شده	fa
موضوعات مقاله منتشر شده
نوع مقاله منتشر شده

برگشت به: صفحه اول پایگاه \| نسخه مرتبط \| نشریه مرتبط \| فهرست نشریات

ارسال پیام برخط

در صورت مشاهده هر نوع اشکال در داده های پایگاه و یا برای ارسال نظرات و پیشنهاد های خود می توانید با پر کردن فرم تماس ما را در جریان قرار دهید.
برای پر کردن فرم تماس اینجا را کلیک کنید.

آمار پایگاه

نمایه شده در ISI 135

نمایه شده در PubMed 109

نمایه شده در Scopus 192

کاربران برخط 657

بازدید امروز 16060

بازدید کل 39205056

اطلاعات تماس

آدرس : تهران، سعادت آباد، بلوار پاکنژاد شمالی، بالاتر از میدان سرو، نبش کوچه ندا، پلاک ۶۸، ساختمان جاوید، واحد ۱۶

پست الکترونیک: yektaweb-AT-gmail.com

توجه

کلیه حقوق این وب سایت و مطالب آن متعلق به شرکت یکتاوب بوده و استفاده از مطالب آن با ذکر منبع بلامانع است
طراحی و برنامه نویسی: یکتاوب افزار شرق