برای بیش از یک قرن، دانشمندان در برابر معمایی خاموش ایستاده بودند. خط پهلوی، زبان رسمی ایران ساسانی، سیستمی نوشتاری با پیچیدگی کمنظیر است که در آن واژهها به زبان آرامی نگاشته میشدند، اما به فارسی میانه خوانده میشدند. گویی هر سند، یک پیام رمزنگاریشده است که کلیدش در بافت جمله پنهان است. حال،آیا این قفل باستانی شکسته می شود.
۱
یک راهحل دوپاره برای یک مشکل واحد
طراحی سیستمی که از دو جبهه به این چالش میتازد. این سیستم، یک «موتور رمزگشایی و ترمیم متون پهلوی» است که با الهام از دو دانش ساخته شده: رمزنگاری مدرن و پردازش سیگنالهای مخابراتی.
سر اول، رمزنگار: این بخش با استفاده از یک مدل مخفی مارکوف (HMM) و الگوریتم ویتربی، توالی هتروگرامهای آرامی را دریافت کرده و با تحلیل احتمالاتی ساختار جمله، محتملترین معادل فارسی میانه را پیشبینی میکند. عملکرد آن شبیه شکستن یک رمز جانشینی پیچیده و وابسته به بافت است.
سر دوم، ترمیمگر: در این بخش، مشکل کتیبههای فرسوده و ناخوانا، مانند یک سیگنال رادیویی ضعیف و نویزی در نظر گرفته میشود. یک فیلتر ذرهای قدرتمند، با نمونهگیری از هزاران احتمال و مقایسه آنها با مدل زبانی، بخشهای گمشده و تخریبشده را شاید بازسازی کند. نهایتاً، یک مدل انتشار شرطی، متن را صیقل داده و منسجمترین و دقیقترین خوانش ممکن را ارائه میدهد.
۲
اثبات مفهوم: فراتر از تئوری
برای اثبات عملی این راهحل، یک نمونه اولیه کامل با دادههای شبیهسازیشده اما به شدت واقعگرایانه ساخته می شود.
دادهٔ ورودی
یک متن ششکلمهای به خط پهلوی شبیهسازی شده که ترکیبی از هتروگرامهای اصیل آرامی (مانند MLKʾ به معنای «شاه»، ʿBD به معنای «کرد»، YWM به معنای «روز») و کلمات فارسی میانه (مانند ud به معنای «و») بود. سپس عمداً:
- ۳۰٪ متن را تخریب می کنیم (شکستگیهای تصادفی سنگنوشته که با علامت
###مشخص میشوند). - خطاهای کاتبان را شبیهسازی کردیم (جابهجایی حروف در برخی هتروگرامها، مثلاً نوشتن نادرست یک واژه آرامی).
متن آسیبدیدهای که به سیستم خوراندیم، چیزی شبیه این بود:
MN ### HWYT ### ud MLKʾ (از) (ناخوانا) (بود) (ناخوانا) (و) (شاه)
خروجی
موتور رمزگشایی و ترمیم، این رشتهٔ ناقص و رمزآلود را طی سه مرحله پردازش می کند:
- ابتدا هتروگرامها را رمزگشایی می کند (
MLKʾبهšāhبرگردانده شد). - سپس شکستگیها (
###) را با استفاده از فیلتر ذرهای و قواعد دستوری فارسی میانه پر می کند. - در پایان، مدل انتشار شرطی، کل جمله را برای انسجام نهایی پالایش می کند.
نتیجه، متنی روان و کاملاً معنادار به فارسی میانه است که ساختار دستوری آن با الگوهای شناختهشدهٔ زبان پهلوی تطابق دارد.
### ### rāy ʿBD pad ZNHzan kard rāy kard rāy ēn۳نمودار گواه است: دو تصویر، یک حقیقت
برای شفافسازی کامل، کارنامهٔ تصویری سیستم در قالب دو نمودار ارائه میشود.

شکل ۱: کارنامه تصویری موتور ترمیم گر کهن
این نمودار چه میگوید؟
۱. نمودار ستونی سمت چپ: شمارش عناصر کلیدی متن
این نمودار سه عدد مهم را کنار هم گذاشته است:
هتروگرام کل : در متن ورودیِ ۶ کلمهای، دقیقاً دو واژه با الفبای آرامی نوشته شده بودند که باید به فارسی برگردانده میشدند:
ʿBDوZNH. به همین دلیل عدد ۲ را میبینید، نه ۴ یا ۶. دو واژهٔ دیگر (rāyوpad) خودشان فارسی هستند و هتروگرام نیستند، و دو تای دیگر هم بخشهای تخریبشده (###) میباشند.هتروگرام حلشده : سیستم توانست هر دو هتروگرام موجود را بهدرستی رمزگشایی کند (
ʿBDبهkardوZNHبهēn). برابری این ستون با ستون اول نشان میدهد که هیچ هتروگرامی از قلم نیفتاده و نرخ موفقیت ۱۰۰٪ بوده است.شکستگیها : از شش جایگاه جمله، دو جایگاه در اثر فرسایش یا آسیب کاملاً ناخوانا شده بودند (
###). موتور موظف بود همین دو جای خالی را با حدس مبتنی بر دستور زبان فارسی میانه پر کند.
۲. نقشهٔ گرمایی سمت راست: مسیر تبدیل از ورودی به خروجی
این نقشه یک جدول ۲ ردیفه است:
ردیف بالا: توالی کلمات متن ورودی (همان متن آسیبدیده و رمزآلود).
ردیف پایین: توالی کلمات متن خروجی (پس از رمزگشایی، ترمیم شکستگیها و پالایش نهایی).
هر رنگ نمایندهٔ یک کلمهٔ یکتاست. برای مثال، rāy یک رنگ، ʿBD رنگی دیگر، ### رنگی دیگر، و واژههای فارسی خروجی مانند kard و zan و ēn نیز هر یک رنگ خاص خود را دارند.
نکتهٔ مهم: در این نقشه قرار نیست همهٔ رنگهای بالا و پایین یکسان باشند. چون سیستم عمداً کلمهها را تغییر داده است: هتروگرامها (ʿBD و ZNH) به فارسی برگردانده شدهاند، و شکستگیها (###) با کلماتی تازه پر شدهاند. به همین دلیل، فقط در یک جایگاه (واژهٔ rāy که هم در ورودی و هم در خروجی یکسان مانده) رنگ دو ردیف مشابه است. در بقیهٔ جایگاهها تغییر رنگ نشاندهندهٔ عملکرد موفق سیستم است: تبدیل واژهٔ آرامی به فارسی، یا جایگزینی بخش تخریبشده با یک کلمهٔ معنیدار.
بنابراین، آشفتگی رنگی ردیف بالا در برابر یکنواختی ردیف پایین، دقیقاً گویای قدرت سیستم در منظمسازی و ترمیم متن باستانی است. این همان چیزی است که از یک موتور رمزگشایی انتظار داریم: از مجموعهای نمادهای ناهمگن، متنی یکدست و روان خلق کند.
۴
آماده برای میدان واقعی
نتایج اجرای خط لوله:
- هتروگرامهای پیچیدهای چون
MLKʾوʿBDبا موفقیت به معادلهای فارسیšāhوkardرمزگشایی شدند. - بخشهای ناخوانا و تخریبشده که با علامت
###مشخص شده بودند، بر اساس قواعد دستوری و بافت جمله، با کلماتی کاملاً معنادار و منسجم جایگزین شدند.
این سیستم، آماده است تا با تغذیه از پیکرههای واقعی دیجیتالشده (همچون پروژههای ADA و CAB)، از یک نمونهٔ آزمایشگاهی به ابزاری ضروری برای ایرانشناسان، موزهها، دانشگاهها، و مجموعهداران خصوصی در سراسر جهان تبدیل شود.
نکتهٔ فنی :
این نسخهٔ با دادههای کاملاً مصنوعی اما واقعگرایانه ساخته شده است (روشی که در علوم مهندسی «Proof of Concept» نامیده میشود). هدف، اثبات امکانپذیری ایده پیش از سرمایهگذاری روی دادههای واقعی است.
🛡️ قوانین کپیرایت و بازنشر محتوا:
کلیه حقوق مادی و معنوی، ایدهپردازیها و مقالات منتشر شده در وبسایت قمر محفوظ میباشد.
به اطلاع میرساند جهت حفظ حقوق مولف، تمامی محتواهای متنی و تصویری وبسایت قمر در لحظه انتشار، توسط مراجع بینالمللیِ ثبت دیجیتال با درج تاریخ و ساعت دقیق (Timestamp) به عنوان مالکیت معنوی این مجموعه مستندسازی و بایگانی میشوند.
بازنشر و استفاده از مطالب این سایت تنها با ذکر دقیق نام منبع و درج لینک مستقیم (فالو) به صفحه اصلی مقاله مجاز است. در صورت مشاهده هرگونه کپیبرداری غیرمجاز و بدون ارجاع به منبع، مدارکِ تقدم زمانیِ ثبتشده مستقیماً برای موتورهای جستجو (در قالب فرمهای DMCA گوگل) و شرکتِ هاستینگِ سایتِ متخلف ارسال خواهد شد که میتواند منجر به حذف لینکهای سایت خاطی از نتایج جستجو و مسدود شدن سرور آنها گردد.