از مکتب فرانسوی تا ترنسفورمر چهارچوبی محاسباتی برای ردیابی بینامتنیت چندزبانه

از مکتب فرانسوی تا ترنسفورمر: چهارچوبی محاسباتی برای ردیابی بینامتنیت چندزبانه

 

 

ادبیات هیچ‌وقت در یک جزیره دورافتاده و منزوی شکل نمی‌گیرد. نویسندگان، شاعران و متفکران در طول تاریخ همواره آثار یکدیگر را خوانده‌اند، از هم الهام گرفته‌اند و گاهی مفاهیم یا حتی جملاتی را از زبانی به زبان دیگر وام گرفته‌اند. وقتی یک متن فارسی را می‌خوانیم، گاهی حس می‌کنیم سایه‌ای از یک اندیشه یا متن کهن عربی در پس‌زمینه آن در حال نفس کشیدن است. به این ارتباطات نامرئی و گفتگوی خاموش میان متن‌ها، در دنیای ادبیات «بینامتنیت» می‌گویند.

اما پیدا کردن این شباهت‌ها و ردیابی این نشانه‌ها در میان هزاران صفحه کتاب، برای انسان کاری به شدت طاقت‌فرسا و گاهی غیرممکن است. اینجاست که پای فناوری به میان می‌آید. با این حال، یک مشکل بزرگ و یک شکاف عمیق در ابزارهای فعلی وجود دارد.

مشکل کجاست؟

ابزارها و برنامه‌های کامپیوتری موجود، معمولاً مثل یک ذره‌بینِ ساده و تک‌بعدی عمل می‌کنند. آن‌ها فقط به دنبال کلماتی می‌گردند که دقیقاً و عیناً «کپی» شده باشند، آن هم در یک زبانِ واحد. اگر یک نویسنده، مفهومی را از زبان عربی به فارسی ترجمه کرده باشد، یا ساختار و سبک یک متن را با کلمات خودش بازنویسی کرده باشد، این ابزارهای کامپیوتری کاملاً گیج و نابینا می‌شوند. آن‌ها توانایی درک محیط‌های چندزبانه و پیچیدگی‌های معنایی را ندارند و عملاً در برابر متون ادبی و تاریخی کم‌می‌آورند.

راه حل چیست؟

برای پر کردن این شکاف، مفهومی تحت عنوان «بینامتن‌یاب چندزبانه تطبیقی» (Comparative Multilingual Intertextuality Detector) تعریف شده است. ایده اصلی این است که به جای جستجوی کورکورانه برای پیدا کردن کلمات تکراری، یک سیستم چندلایه و هوشمند داشته باشیم که بتواند متن‌ها را مانند یک انسانِ مسلط به دو زبان، تحلیل و مقایسه کند.

البته در همین نقطه باید به یک مسئله بسیار مهم اشاره کرد: این مفهوم در حال حاضر صرفاً یک «ایده پژوهشی» است و هیچ‌گونه قطعیتی درباره عملکرد نهایی آن وجود ندارد. تمام فرآیندهای مرتبط با این ایده در قالب شبیه‌سازی‌ها تعریف می‌شوند و رسیدن به نتیجه قطعی، وابستگی کاملی به تست شدن توسط داده‌های واقعی و حجم عظیمی از متون دارد.

برای شکل دادن به چنین مفهومی، نیاز است که علومی کاملاً متفاوت با هم دست به دست دهند. در این مسیر، از یک سو نظریات ادبی (مانند مکتب فرانسوی و نظریات ژرار ژنت در خصوص روابط بین‌متنی) به عنوان پایه تفکر استفاده شده است و از سوی دیگر، شاخه‌های پیشرفته هوش مصنوعی و پردازش زبان طبیعی (NLP) به کار گرفته شده‌اند.

در سیستم «بینامتن‌یاب چندزبانه تطبیقی»، از روش‌ها و فناوری‌های پیچیده‌ای کمک گرفته می‌شود که هر کدام وظیفه خاصی دارند، از جمله:

  • مدل‌های زبانی عمیق (Transformers): برای درک معنای پنهان جملات در زبان‌های مختلف، تا سیستم متوجه شود دو جمله با کلمات متفاوت، دقیقاً یک معنی را می‌دهند.
  • یادگیری تقابلی (Contrastive Learning): روشی برای آموزش سیستم تا بتواند تفاوت‌های بسیار ظریف معنایی را تشخیص دهد.
  • تحلیل‌های سبکی و هم‌پوشانی‌های واژگانی (N-gram overlapping & Stylistic analysis): برای پیدا کردن نقل‌قول‌های مستقیم، ترجمه‌های تحت‌اللفظی و حتی تشخیص اینکه آیا نویسنده دوم، ناخودآگاه از «سبک نوشتن» نویسنده اول تقلید کرده است یا خیر.

با ترکیب این روش‌ها، یک متن از چندین فیلترِ واژگانی، معنایی و سبکی عبور می‌کند تا در نهایت مشخص شود آیا بین دو متن در دو زبان مختلف (مثلاً فارسی و عربی) رابطه‌ای از جنس نقل‌قول، بازنویسی، یا تاثیرپذیری وجود دارد یا خیر.

سخن پایانی

پیوند زدن ظرافت‌های ادبیات به محاسبات سخت‌افزاری کامپیوترها، یکی از جذاب‌ترین چالش‌های دنیای امروز است. با این حال، حتماً باید این نکته را مجدداً تکرار و تاکید کرد که ساختاری مثل «بینامتن‌یاب چندزبانه تطبیقی»، در گام‌های فعلی صرفاً یک سیستم مبتنی بر شبیه‌سازی است. دنیای کلمات پر از استعاره و ابهام است و نتایج قطعی چنین ایده‌ای، تنها زمانی قابل اتکا خواهد بود که با موفقیت از سدِ آزمایش با داده‌های واقعی و متون تاریخیِ اصیل عبور کند.

 

🛡️ قوانین کپی‌رایت و بازنشر محتوا:

کلیه حقوق مادی و معنوی، ایده‌پردازی‌ها و مقالات منتشر شده در وب‌سایت قمر محفوظ می‌باشد.

به اطلاع می‌رساند جهت حفظ حقوق مولف، تمامی محتواهای متنی و تصویری وب‌سایت قمر در لحظه انتشار، توسط مراجع بین‌المللیِ ثبت دیجیتال با درج تاریخ و ساعت دقیق (Timestamp) به عنوان مالکیت معنوی این مجموعه مستندسازی و بایگانی می‌شوند.

بازنشر و استفاده از مطالب این سایت تنها با ذکر دقیق نام منبع و درج لینک مستقیم (فالو) به صفحه اصلی مقاله مجاز است. در صورت مشاهده هرگونه کپی‌برداری غیرمجاز و بدون ارجاع به منبع، مدارکِ تقدم زمانیِ ثبت‌شده مستقیماً برای موتورهای جستجو (در قالب فرم‌های DMCA گوگل) و شرکتِ هاستینگِ سایتِ متخلف ارسال خواهد شد که می‌تواند منجر به حذف لینک‌های سایت خاطی از نتایج جستجو و مسدود شدن سرور آن‌ها گردد.

اشتراک گذاری:

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *