سپتامبر 20, 2026

عاشق وب

سایتی برای دوستداران وب. اخبار روز فناوری اطلاعات را در سایت عاشق وب دنبال کنید

فناوری كلیدی در هوش مصنوعی؛ پژوهشگر ایرانی چه طور نفرین داده ها در ابعاد بالا را شکست؟

فناوری كلیدی در هوش مصنوعی؛  پژوهشگر ایرانی چه طور نفرین داده ها در ابعاد بالا را شکست؟
عاشق وب: پژوهشگر ایرانی راهکاری مؤثر برای جست وجوی سریع داده های مشابه در مجموعه های عظیم ارایه کرده است؛ دستاوردی که امروز از فناوری های کلیدی در پردازش کلان داده و هوش مصنوعی به حساب می آید.
Rate this post

به گزارش عاشق وب به نقل از مهر، وقتی روی یک خط مستقیم ایستاده اید و می خواهید نزدیک ترین فرد به خودرا پیدا کنید، کار ساده است: فقط کافی است به چپ و راست نگاه کنید و فاصله تان را با افراد اطراف مقایسه کنید. حال اگر در یک اتاق باشید، باید نزدیک ترین فرد را در فضای دوبعدی پیدا کنید. باز هم مشکل چندانی وجود ندارد؛ با چرخیدن به دور خود و بررسی فاصله ها در جهات مختلف، می توانید جواب را بیابید.
اما اگر افراد بتوانند در فضای سه بعدی شناور شوند، چه؟ در این صورت، مساله پیچیده تر می شود؛ چون باید جست وجو را در ارتفاع، عمق و عرض انجام دهید. اگر بُعد زمان را هم اضافه نماییم، اوضاع بطورکامل بغرنج می شود. حتی اگر تمام عمرتان هم وقت داشته باشید، آیا می توانید نزدیک ترین فرد را در یک فضای چهاربعدی پیدا کنید؟
واقعیت تکان دهنده اینجاست: خیلی از داده های دنیای حقیقی در ابعاد بسیار بالاتری وجود دارند؛ گاهی ۱۰۰ بُعد یا حتی بیشتر. این داده ها نفرین شده اند!
در این میان، دکتر وهاب میررکنی، پژوهشگر ایرانی و دانش آموخته دانشگاه صنعتی شریف و مؤسسه فناوری ماساچوست (MIT)، با عرضه الگوریتم «هش حساس به مجاورت» (LSH)، راهکاری مؤثر برای جست وجوی سریع داده های مشابه در مجموعه های عظیم عرضه کرد؛ دستاوردی که امروز از فناوری های کلیدی در پردازش کلان داده و هوش مصنوعی محسوب می شود. میررکنی که حال از محققان ارشد گوگل است، به پاس این موفقیت، در سال ۲۰۲۵ به عنوان یکی از برگزیدگان جایزه مصطفی(ص) معرفی گردید.
برای درک بهتر این موفقیت، بهتر است ابتدا با یکی از چالش های بنیادین عصر داده بیشتر آشنا شویم؛ مساله ای که یافتن یک قطعه اطلاعات پرارزش در بین انبوهی از داده ها را به جست وجوی سوزنی در انباری عظیم از کاه مبدل کرده است.

داده های نفرین شده

با پیشرفت فناوری و ورود داده های مختلف به دنیای محاسبات و پردازش، با انواع مختلفی از داده های نفرین شده روبه رو شده ایم. یک تصویر رنگی ۱۰۰۰×۱۰۰۰ پیکسلی (که هر پیکسل در آن یک بُعد است) در کامپیوتر، داده ای سه میلیون بعدی محسوب می شود! چونکه برای نگهداری هر پیکسل، باید ترکیب سه تایی قرمز، سبز و آبی، که یکی از روشهای استاندارد نگهداری تصاویر رنگی است، ذخیره شود. حتی با استفاده از روشهای کاهش ابعاد، باز هم در مسایل پردازش تصویر با صدها یا هزاران بُعد سروکار داریم.
زمانی که قصد پردازش فایل های متنی را داریم، در واقع وارد فضای مسائلی می شویم که به آن پردازش زبان طبیعی گفته می شود. در اینگونه موارد، کلمات با روش هایی به بردار عددی تبدیل می شوند. به هر کلمه یک بردار عددی n-بعدی (۱۰۰ تا ۳۰۰ بُعدی) نسبت داده می شود، بگونه ای که کلمات مشابه، بردارهای مشابهی داشته باشند. سپس برای پردازش یک متن، کلمات اصلی شناسایی، استخراج و بررسی می شوند. با این شیوه ها، یک متن که تلفیقی از چندین کلمه است، داده ای با ابعاد بسیار بالا خواهد بود. یک پاراگراف می تواند ده ها هزار بُعد داشته باشد!
نمونه ای دیگر از داده هایی که در دهه اخیر بسیار مورد توجه قرار گرفته، داده های ژنتیکی هستند. در هر سلول از هر موجود زنده ای، مولکولی به نام DNA وجود دارد که از به هم پیوستن ۴ نوع مولکول ساده تر که به «باز» معروف اند، تشکیل شده است. با عنایت به اینکه طول آن در انسان به حدود ۳ میلیارد تکرار از این بازها می رسد، از نظر نظری میتوان تنوع بسیار بالایی برای آن درنظر گرفت. بخشهایی از DNA در ضمن نسل ها تا حد بسیار زیادی حفظ می شوند و عملکرد بدن موجود زنده را تعیین می کنند که به آنها ژن گفته می شود. نگهداری اطلاعات DNA هر انسان می تواند به دو شکل صورت گیرد: یا کل توالی مولکولی آن نگهداری شود، یا تنها بخش های ژن که حدوداً ۲۵ هزار بخش با طول های متفاوت هستند، نگهداری شود. در هر صورت، با حجم اطلاعات بسیار بالایی مواجه خواهیم بود.

چالش جست وجو در داده های پُربُعد؛ همه نزدیک اند و همه دور!

در چنین فضای پُربُعدی، «نفرین ابعاد بالا» رخ می دهد. نفرین این چنین است که داده ها به صورت عجیبی پراکنده می شوند، طوری که تقریبا همه چیز به یک اندازه از هم فاصله دارند. بعبارت دیگر، مفهوم «شباهت» از بین می رود، چون همه داده ها تقریبا یکسان به نظر می رسند و جست وجوی نزدیک ترین همسایه یا شبیه ترین داده، به یک مأموریت غیر ممکن تبدیل می شود و محاسبات، غیرعملی می گردند.
مسئله جست وجوی نزدیک ترین همسایه یکی از مسایل کلیدی در علوم داده، یادگیری ماشین و بازیابی اطلاعات است. هدف اصلی این مسئله، یافتن نزدیک ترین نقطه (یا نقاط) به یک نقطه داده شده است که می تواند بر مبنای یک معیار شباهت مطرح شود. معیارهای مختلفی برای سنجش فاصله داده ها وجود دارد. دو نوع از ساده ترین آنها، فاصله اقلیدسی و فاصله منهتن است. در فاصله اقلیدسی، طول پاره خطی که آن دو نقطه را در فضا مستقیماً به یکدیگر وصل می کند، مدنظر است و در فاصله منهتن، فاصله پلکانی برای رسیدن از یک نقطه به نقطه دیگر درنظر گرفته می شود؛ یعنی حاصل جمع اختلاف داده ها در ابعاد مختلف.
یافتن شبیه ترین تصویر به تصویر مدنظر ما از میان یک پایگاه داده تصویری، یا یافتن شبیه ترین موجودات به یکدیگر به لحاظ ژنتیکی و ساخت شجره نامه موجودات از دیدگاه تکامل، به نظر صورت مساله های ساده ای می آیند، اما چالش های بسیار پیچیده ای دارند. گاهی حتی نیازهایی بر مبنای تشخیص شباهت متنی و تقلب علمی مطرح می شود یا تحلیلی از احساسات بیان شده در متن ها مدنظر است. بازار تبلیغات و آگهی و سیستم های پیشنهاددهنده هم اگر بخواهند بنا بر سلیقه شما و کاربران مشابه، محصولی پیشنهاد دهند، از این چالش ها مستثنی نیستند. در حقیقت، در تمام این مسایل عنوان شده، ما تنها بدنبال شبیه ترین داده به یک داده خاص هستیم که اگر ابعاد داده ها کم بود، با روشهای سنتی و الگوریتم های سریع، پاسخ در زمان معقولی آماده بود؛ اما آن چه ما را در پاسخ دادن به این پرسش ها گرفتار مشکل می کند، ابعاد بسیار بالای آن هاست.

شباهت در دنیایی دیگر!

محققان بسیاری تلاش در عرضه چاره ای برای این مساله داشته اند و با عنایت به فضای بسیار پیچیده مسئله، صورت مساله را بجای یافتن «نزدیک ترین داده»، به یافتن «داده به قدر لازم نزدیک» تغییر دادند. اما باز هم از پیچیدگی مبحث کم نشد. یکی از مؤثرترین افراد این حوزه، وهاب میررکنی است که این داده ها را می شناخت و می دانست که نمی توان مستقیم با آنها دست وپنجه نرم کرد؛ چونکه نفرین آنها به این راحتی شکسته نمی شود و فضا بسیار پیچیده تر از آنست که بتوان مستقیم وارد عمل شد.
شاید اگر مساله را به این شکل نگاه نماییم، بتوانیم درک خوبی از تحقیقات این دانشمند پیدا کنیم: کتابی خوانده اید که شما را به شدت به خود جذب کرده است. بعد از اتمام کتاب، بدنبال خواندن کتاب دیگری می گردید که فضای ذهنی شما را به همان شکل به خود جذب نماید. چطور می توان چنین کتابی را از میان میلیونها کتاب با انواع و اقسام نویسنده، مبحث و عنوان و… یافت؟ مسلماً عاقلانه نخواهد بود اگر یک نفر زمان خودرا صرف آن کند که تمام کتاب های کتابخانه را بخواند و ببیند کدام یک به کتاب مورد علاقه او شبیه تر است!
در سال ۱۹۹۸، ایده مبتنی بر «هش حساس به مجاورت» به نام LSH عنوان شد که شیوه جست وجو در داده ها را متحول کرد: بجای مقایسه مستقیم میلیونها معیار، میتوان از روش دسته بندی هوشمندانه استفاده کرد. تصور کنید کتابخانه ای عظیم دارید. بجای بررسی تک تک کتاب ها، ابتدا آنها را بر مبنای مبحث دسته بندی می کنید: تاریخی، فلسفی، ادبی و… و زمانی که بدنبال کتابی مشابه می گردید، فقط در قسمت مربوطه جست وجو می کنید. این همان ایده تبدیل داده های پیچیده به فضایی ساده تر است؛ کاری که با توابع هش ممکن می شود.
البته این ایده در ابتدا خام بود. دسته بندی های تک بعدی (مثلاً فقط بر طبق موضوع) ممکن بود ناقص باشد. برای حل این مشکل، از چندین روش دسته بندی همزمان استفاده شد. بطورمثال کتاب ها را نه تنها بر مبنای موضوع، بلکه بر طبق حجم (رمان بلند، داستان کوتاه) و دوره تاریخی (رنسانس، معاصر) هم طبقه بندی می کردند. حالا هر کتاب در چندین گروه قرار می گرفت. به عنوان نمونه، رمان بلندی با مبحث فلسفی و متعلق به قرن پنجم، تنها با کتاب های هم گروه خود مقایسه می شد. به این ترتیب، داده های میلیون بعدی به چند بُعد ساده تقلیل می یافتند و جست وجو بسیار سریع تر انجام می شد.
اما یافتن چنین توابع هشی در ریاضیات کار ساده ای نبود؛ چونکه باید از توابعی استفاده می شد که شباهت در دنیای اصلی را حفظ می کردند و داده های شبیه به هم را به مکانی نزدیک به هم در دنیای جدید می بردند. چاره، استفاده از توابع هش تصادفی بود. چرا تصادفی؟ چون داده ها آن قدر پیچیده هستند که پیش بینی بهترین روش دسته بندی غیر ممکن است. از طرفی، توابع تصادفی با بوجودآوردن نمایی غیرقابل پیش بینی از داده ها، گاهی دسته بندی های بهتری عرضه می دادند.
LSH تا بدین جا خوب عمل کرده بود، اما محدود بود و برای حفظ شباهت، عموماً از توابع هش مشابه تر استفاده می کرد و از توابع نادر کمتر بهره می گرفت. در حقیقت، به شکلی توابع هش مورد استفاده مبنی بر توزیع نرمال تولید می شدند؛ بنابراین، تنها می توانست روی دو معیار محاسبه فاصله یا متر معروف، اقلیدسی و منهتن، پاسخ مناسب عرضه نماید. به این دلیل، این شیوه برای هر نوع داده و هر متری کارآیی لازم را نداشت و حفظ شباهت در فضای جدید را برای هر نوع داده ای تضمین نمی کرد.
در سال ۲۰۰۴ بود که وهاب میررکنی و همکارانش با عرضه تعمیمی نوآورانه، همه چیز را تغییر دادند. آنها با معرفی LSH مبتنی بر توزیع های پایدار، سیستمی ساختند که تقریبا با هر نوع داده و معیاری سازگار بود. در این تکنیک، تولید توابع هش تنها متمرکز بر توزیع نرمال نبود و توابع هش نادر هم امکان استفاده بیشتری داشتند و درنتیجه، داده ها را با توابع عجیب تر بیشتری می شد دسته بندی کرد و بسته به نوع معیار محاسبه فاصله مدنظر، می توانست توزیع توابع را تغییر داد. در حقیقت، هنر میررکنی این بود که از نظر ریاضی، امکان استفاده از روشهای متنوع و حتی نادرتری برای دسته بندی داده ها را فراهم نمود.
میررکنی و همکارانش با سودجستن از توزیع های پایدار، این اطمینان را دادند که داده های مشابه در فضای جدید هم نزدیک به هم باقی می مانند. زیبایی کار این بود که این شیوه برای هر معیاری، از اقلیدسی و منهتن تا معیارهای محاسبه فاصله پیچیده دیگر هم قابل استفاده بود.
نتایج اعجاب انگیز بود: روش جدید تا ۴۰ برابر سریع تر از روشهای سنتی عمل می کرد. میررکنی با این نوآوری، موفقیت برجسته ای در دنیای جست وجوی داده های پُربُعد ایجاد کرد. دیگر سرعت و دقت جست وجو به تعداد ابعاد داده وابسته نبود. حالا می شد در بین میلیونها کتاب، به آسانی و با سرعت بالا، کتاب بعدی را برای مطالعه پیدا کرد و نگران نفرین ابعاد بالا نبود. این همان هنر تبدیل جهان پیچیده داده ها به فضایی ساده و قابل مدیریت بود. با عرضه این راهکار، زمینه ای برقرار شد تا افرادی که روی داده هایی با ابعاد بالا، از تصویر گرفته تا صدا و متن و داده های ژنتیکی و نظرسنجی های سایت ها و پیشنهاددهنده های محصول و… مطالعه می کنند، بتوانند هر زمان لازم بود، از این ایده بهره گیرند.
خلاصه اینکه چراکه برای نگهداری هر پیکسل، باید ترکیب سه تایی قرمز، سبز و آبی، که یکی از روشهای استاندارد نگهداری تصاویر رنگی است، ذخیره شود. در فاصله اقلیدسی، طول پاره خطی که آن دو نقطه را در فضا مستقیماً به یکدیگر وصل می کند، مدنظر است و در فاصله منهتن، فاصله پلکانی برای رسیدن از یک نقطه به نقطه دیگر در نظر گرفته می شود؛ یعنی حاصل جمع اختلاف داده ها در ابعاد مختلف. اما باز هم از پیچیدگی مبحث کم نشد.

منبع: