نقشه برداری سلسله مراتبی برای تعبیه کلمه متقاطع

ساخت وبلاگ

این یک مقاله دسترسی آزاد است که تحت شرایط مجوز بین المللی Creative Commons Attribution 4. 0 توزیع شده است ، که به شرط استفاده از کار اصلی ، به شرط استفاده صحیح از آن ، امکان استفاده ، توزیع و تولید مثل بدون محدودیت را فراهم می کند. برای توضیحات کامل در مورد مجوز ، لطفاً به https://creativeecommons. org/licenses/by/4. 0/legalcode مراجعه کنید

معاملات انجمن زبانشناسی محاسباتی (2020) 8: 361-376. تجدید نظر دریافت شده: 01 فوریه 2020 اخذ شده: 01 ژوئیه 2020 استناد

یون مادرازو آزپیازو ، ماریا سولداد پرا ؛نقشه برداری سلسله مراتبی برای تعبیه کلمه متقاطع. معاملات انجمن زبانشناسی محاسباتی 2020 ؛8 361-376. doi: https://doi. org/10. 1162/tacl_a_00320

دانلود پرونده استناد:

نوار ابزار

خلاصه

تراز فضاهای تعبیه شده کلمه به زبانهای مختلف به یک فضای متقاطع مشترک اخیراً رواج داشته است. استراتژی هایی که این کار را انجام می دهند ، ترازهای زوجی را محاسبه کرده و سپس چندین زبان را به یک زبان محوری واحد (اغلب انگلیسی) ترسیم می کنند. با این حال ، این استراتژی ها نسبت به انتخاب زبان محوری مغرضانه هستند ، با توجه به اینکه مجاورت زبان و خصوصیات زبانی زبان مقصد می تواند به شدت بر فضای متقاطع حاصل به ضرر زبانهای دوردست از نظر توپولوژیکی تأثیر بگذارد. ما یک استراتژی ارائه می دهیم که با یادگیری نقشه برداری ها در سراسر زبان ها به روشی سلسله مراتبی ، نیاز به یک زبان محوری را از بین می برد. آزمایشات نشان می دهد که استراتژی ما به طور قابل توجهی نمرات القاء واژگان را در تمام معیارهای موجود ، و همچنین در یک معیار جدید غیر انگلیسی که ما ساخته ایم ، بهبود می بخشد ، که ما در دسترس عموم قرار می دهیم.

1. معرفی

تعبیه های کلمه با توجه به قابلیت های آنها برای نشان دادن معنی کلمات ، نحوه ساخت برنامه های پردازش متن را تغییر داده اند (میکولوف و همکاران ، 2013a ؛ پنینگتون و همکاران ، 2014 ؛ بوژانوفسکی و همکاران ، 2017). استراتژی های نسل تعبیه سنتی بسته به زبان ، تعبیه های مختلفی را برای همین کلمه ایجاد می کند. حتی اگر خود تعبیه ها در بین زبانها متفاوت باشند ، توزیع آنها تمایل به هماهنگ بودن دارد - مسافت های نسبی در تعبیه های کلمه ای بدون در نظر گرفتن زبان حفظ می شوند (Mikolov et al. ، 2013b). این رفتار با تراز کردن هر دو فضای تعبیه شده یک زبانه در یک مورد برای تولید تعبیه Crosslingual مورد سوء استفاده قرار گرفته است (Dinu et al. ، 2014 ؛ Xing et al. ، 2015 ؛ Artetxe et al. ، 2016).

تکنیک های تراز در تولید فضاهای تعبیه دو زبانه موفقیت آمیز بوده اند که بعداً می توانند با استفاده از یک زبان محوری در یک فضای متقاطع ادغام شوند و انگلیسی رایج ترین انتخاب است. متأسفانه ، نقشه برداری از یک زبان به دیگری از یک مشکل بی طرفی رنج می برد ، زیرا فضای دو زبانه حاصل توسط پدیده های خاص زبان و تعصبات خاص جسد از زبان هدف تأثیر می گذارد (Doval و همکاران ، 2018). برای پرداختن به این مسئله ، Doval و همکاران.(2018) نقشه برداری از هر دو زبان را در یک فضای میانی متفاوت ارائه می دهد. با این حال ، این نقشه برداری مانع استفاده از یک زبان محوری برای ادغام چندین فضای دو زبانه در یک متقاطع می شود و راه حل را برای یک سناریوی دو زبانه محدود می کند. علاوه بر این ، استراتژی محوری از یک مشکل تعصب عمومی رنج می برد ، زیرا زبانهایی که بیشتر شبیه محوری هستند ، تراز بهتری دارند و بنابراین در فضای متقاطع بهتر نشان می دهند. این امر به این دلیل است که نزدیکی زبان یک عامل اصلی هنگام یادگیری تراز است. این با نتایج در Artetxe و همکاران مشهود است.(2017) ، که نشان می دهد هنگام استفاده از انگلیسی (هند و اروپایی) به عنوان محوری ، نتایج القایی واژگان برای فنلاندی (اورال) حدود 10 امتیاز زیر بقیه زبانهای هند و اروپایی مورد مطالعه است.

اگر بخواهیم بدون توجه به ویژگی های آنها ، همه زبان ها را در همان فضای متقاطع قرار دهیم ، باید فراتر از مدل قطار-زبانه/ادغام شده توسط حرکت (TB/MP) باشیم و در عوض به دنبال راه حل هایی باشیم که می تواند مستقیماً فضاهای متقاطع ایجاد کند بدون نیازیک مرحله دو زبانه. این امر به طراحی HCEG (نسل تعبیه شده تقاطع سلسله مراتبی) ، رویکرد محوری سلسله مراتبی برای تولید فضاهای تعبیه شده متقاطع که در این مقاله ارائه می دهیم ، انگیزه می دهد. HCEG با یادگیری نقشه برداری ترکیبی در چندین زبان به صورت سلسله مراتبی ، هم به نزدیکی زبان و هم به مشکلات تعصب در فضای هدف می پردازد. این کار با استفاده از یک درخت خانوادگی زبان برای جمع کردن چندین زبان در یک فضای متقاطع واحد انجام می شود. آنچه HCEG را از استراتژی های TB/MP متمایز می کند این است که نیازی به شامل زبان محوری در کلیه توابع نقشه برداری نیست. این امکان را برای یادگیری نقشه برداری بین زبانهای مشابه با نوع شناسی فراهم می کند ، که شناخته شده است که نقشه های با کیفیت بهتری دارند (Artetxe و همکاران ، 2017).

  • • یک استراتژی 1 که از یک درخت خانوادگی زبان برای یادگیری ماتریس نقشه برداری که به صورت سلسله مراتبی تشکیل شده اند ، استفاده می کند تا فضاهای تعبیه شده متقاطع را برای خانواده های زبانی به دست آورد.
  • • تجزیه و تحلیل از مزایای تولید سلسله مراتب تولید شده در چندین زبان در مقایسه با استراتژی های سنتی بدون نظارت و تحت نظارت TB/MP سنتی.

2 کار مرتبط

علاقه اخیر به نسل تعبیه شده کلمه متقاطع منجر به استراتژی های چند منظوره شده است که می تواند به چهار گروه طبقه بندی شود (رادر و همکاران ، 2017): (1) تکنیک های نقشه برداری که برای نقشه برداری از یک فضای یک زاویه ای که قبلاً آموزش دیده است به دیگری تکیه می کنند (Mikolovو همکاران ، 2013b ؛ Artetxe و همکاران ، 2017 ؛ Doval و همکاران ، 2018) ؛(2) تکنیک های شبه متقاطع که باعث ایجاد شرکت های متقاطع مصنوعی می شوند که در آن زمان در یک استراتژی یک زبانه سنتی مورد استفاده قرار می گیرند ، با جایگزینی تصادفی کلمات با ترجمه های خود (Gouws and Søgaard ، 2015 ؛ Duong et al. ، 2016) یا با ترکیب متن هابه زبان های مختلف به یک (Vulić and Moens ، 2016) ؛. و (4) رویکردهای با استفاده از یک تابع هدف مشترک که هر دو از دست دادن یکپارچه و متقاطع را بهینه می کند ، که به یک شرکت موازی که در کلمه تراز شده است متکی هستند (Zou et al. ، 2013 ؛ Luong et al. ، 2015) یا سطح جمله (Gouws etAl. ، 2015 ؛ Coulmance et al. ، 2015).

یک عامل اصلی برای تکنیک های تولید تعبیه Crosslingual میزان سیگنال تحت نظارت مورد نیاز است. شرکت های موازی یک منبع کمیاب هستند-حتی برای برخی از زبانهای منزوی یا کم منبع وجود ندارد. بنابراین ، ما بر روی استراتژی های مبتنی بر نقشه برداری تمرکز می کنیم که می توانند فقط به یک واژگان دو زبانه (میکولوف و همکاران ، 2013b) نیاز داشته باشند تا هیچ سیگنال نظارتی کاملاً بدون نظارت داشته باشند (Artetxe و همکاران ، 2018). این برای تحقیقات ما با یکی از محل ها تراز می شود تا بتواند نسل یک فضای تعبیه شده متقاطع را برای هرچه بیشتر زبان امکان پذیر کند.

میکولوف و همکاران.(2013b) برای اولین بار استراتژی نقشه برداری را برای تراز کردن دو فضای یک زبانه معرفی کرد که یک تغییر خطی را از منبع به فضای هدف با استفاده از نزول شیب تصادفی می آموزد. این روش بعداً با استفاده از حداقل مربعات برای یافتن محلول بهینه ، L2-normalizing کلمه تعبیه شده ، یا محدود کردن ماتریس نقشه برداری به صورت متعامد افزایش یافته است (Dinu et al. ، 2014 ؛ Shigeto et al. ، 2015 ؛ Xing et al.. ، 2015 ؛ Artetxe و همکاران ، 2016 ؛ اسمیت و همکاران ، 2017) ؛پیشرفت هایی که به زودی در منطقه استاندارد شد. این مدل ها ، با این حال ، تحت تأثیر Hubness قرار می گیرند ، جایی که برخی از کلمات تمایل دارند در محله تعداد فوق العاده ای از کلمات دیگر قرار بگیرند و باعث ایجاد مشکل در هنگام استفاده از نزدیکترین همسایه به عنوان الگوریتم بازیابی و بی طرفی می شوند ، جایی که فضای متقاطع حاصل از آن بسیار زیاد استبا توجه به ویژگی های زبان مورد استفاده به عنوان هدف. Hubness با تصحیح اعمال شده برای بازیابی نزدیکترین همسایه ، آیا با استفاده از یک نرم افزار معکوس (اسمیت و همکاران ، 2017) یا یک مقیاس محلی شباهت متقابل دامنه (Coeau et al. ، 2017) بعداً به عنوان بخشی از ضرر آموزش گنجانیده شد (جولین و همکاران ، 2018). بی طرفی توسط Doval و همکاران مشاهده شد.(2018) ، که آنها با استفاده از دو تحول خطی مستقل پیشنهاد کردند تا فضای متقاطع حاصل در یک نقطه میانی بین دو زبان باشد نه فقط به زبان هدف ، و بنابراین نسبت به هر دو زبان مغرضانه نیست.

سایر روندهای مهم در منطقه بر روی (i) جستجوی تکنیک های بدون نظارت برای یادگیری توابع نقشه برداری (Coeau et al. ، 2017 ؛ Artetxe et al. ، 2018) و تطبیق پذیری آنها در برخورد با زبانهای کم منبع (Vulić et al.، 2019) ؛. و (iii) فرمولاسیون روشهای ارزیابی قوی تر به منظور تعیین کیفیت فضاهای متقاطع تولید شده (Glavas et al. ، 2019 ؛ Litschko et al. ، 2019).

بیشتر آثار موجود روی یک سناریوی دو زبانه تمرکز می کنند. با این حال ، علاقه به طراحی استراتژی هایی که به طور مستقیم بیش از دو زبان را در زمان آموزش در نظر می گیرند ، افزایش می یابد ، بنابراین فضاهای کاملاً چند زبانه ایجاد می کند که به مدل TB/MP بستگی ندارد (Kementchedjhieva و همکاران ، 2018) برای استنتاج چند زبانه. تلاش برای انجام این کار شامل تلاش های Søgaard و همکاران است.(2015) ، که بر اساس پیوندهای چند زبانه ویکی پدیا برای تولید بازنمودهای کلمه چند زبانه ، از یک شاخص معکوس استفاده می کند. وادا و همکاران.(2019) در عوض از یک مدل زبان عصبی در سطح جمله برای یادگیری مستقیم تعبیه های چند زبانه و در نتیجه دور زدن نیاز به توابع نقشه برداری استفاده کنید. هیمن و همکاران در الگوی تراز کردن تعبیه های از قبل آموزش دیده که در آن تمرکز می کنیم.(2019) تکنیکی را ارائه می دهد که به طور تکراری یک فضای چند زبانه را که از یک فضای یک زبانه شروع می شود و زبان های تدریجی را در آن قرار می دهد ، ایجاد می کند. حتی اگر این استراتژی از مدل سنتی سل/MP منحرف شود ، هنوز هم ایده داشتن یک زبان محوری را حفظ می کند. چن و کاردی (2018) توابع نقشه برداری را در رمزگذارها و رمزگشایی ها جدا می کنند ، که بر خلاف مدل TB/MP وابسته به جفت نیستند. این امر نیاز به یک زبان محوری را برطرف می کند ، با توجه به اینکه فضای چند زبانه اکنون در بین همه رمزگذارها و رمزگشایی ها نهفته است و در یک زبان خاص متمرکز نیست. همان اثر محوری از بین بردن با استراتژی معرفی شده در Jawanpuria و همکاران حاصل می شود.(2019) ، که با القاء یک متریک شباهت Mahanobis در فضای مشترک ، یک استراتژی تعبیه شده کلمه دو زبانه را در یک همتای چند زبانه تعمیم می دهد. با این حال ، این دو استراتژی هنوز هم تمام زبانها را با یکدیگر متناسب می دانند و از شباهت ها و تفاوت هایی که در بین آنها وجود دارد ، نادیده می گیرند.

کار ما از Doval و همکاران الهام گرفته شده است.(2018) و چن و کاردی (2018) ، به این معنا که بر دستیابی به یک فضای متقاطع غیر مغرضانه یا خنثی که نیازی به محوریت انگلیسی (یا هر زبان محوری دیگر) به عنوان منبع اصلی ندارد ، تمرکز دارد. این بی طرفی توسط یک استراتژی نقشه برداری ترکیبی به دست می آید که سلسله مراتبی توابع نقشه برداری را به منظور تولید یک فضای متقاطع واحد و غیر متمرکز با محوریت ترکیب می کند و امکان نقشه برداری بهتر برای زبانهایی را فراهم می کند که از راه دور یا غیر تویولوژیکی مرتبط با انگلیسی هستند.

3 استراتژی پیشنهادی

یک درخت خانوادگی زبانی یک طبقه بندی طبیعی از زبانها است که از لحاظ تاریخی توسط زبانشناسی به عنوان مرجع مورد استفاده قرار گرفته است که شباهت ها و تفاوت ها را در زبان ها رمزگذاری می کند (Comrie ، 1989). به عنوان مثال ، بر اساس فاصله نسبی در بین زبانهای موجود در درخت نشان داده شده در شکل 1 ، استنباط می کنیم که هم اسپانیایی و هم پرتغالی نسبتاً شبیه یکدیگر هستند ، با توجه به اینکه بخشی از همان خانواده ایتالیایی هستند. در عین حال ، هر دو زبان از انگلیسی دورتر از یکدیگر هستند و با توجه به فنلاندی از نظر ظاهری متفاوت هستند.

شکل 1:

Sample language tree representation simplified for illustration purposes (Lewis and Gary, 2015).

نمونه نمایش درخت زبان برای اهداف تصویر ساده شده است (لوئیس و گری ، 2015).

شکل 1:

Sample language tree representation simplified for illustration purposes (Lewis and Gary, 2015).

نمونه نمایش درخت زبان برای اهداف تصویر ساده شده است (لوئیس و گری ، 2015).

یک درخت خانوادگی زبانی یک سازمان طبیعی را ارائه می دهد که می توان هنگام ساخت فضاهای متقاطع که زبانهای متنوع و متنوع را ادغام می کنند ، مورد سوء استفاده قرار گرفت. ما این ساختار را در HCEG اهرم می کنیم ، تا بتوانیم فضای تعبیه شده کلمه متقاطع سلسله مراتبی را ایجاد کنیم. بر خلاف استراتژی های سنتی TB/MP که یک فضای متقاطع واحد ایجاد می کند ، نتیجه HCEG مجموعه ای از ماتریس های تحول است که می تواند برای ترکیب سلسله مراتبی فضای مورد نیاز در هر مورد استفاده شود. این امر به حداکثر رساندن نوع شناختی تایپولوژیکی در بین زبانهای مورد استفاده برای تولید فضای تعبیه ، ضمن به حداقل رساندن تفاوت در زبانها که می تواند مانع از کیفیت فضای تعبیه متقاطع شود. بنابراین ، اگر یک برنامه خارجی فقط زبانهایی را که آلمانی هستند در نظر بگیرد ، می تواند فقط از فضای متقاطع آلمانی تولید شده توسط HCEG استفاده کند ، در حالی که اگر به زبان های فراتر از آلمانی احتیاج داشته باشد ، می تواند از خانواده ای با سطح بالاتر مانند هند و اروپایی استفاده کند. این کار با مدل سنتی سل/MP انجام نمی شود. در این حالت ، اگر یک برنامه ، به عنوان مثال ، فقط با استفاده از زبانهای اورالیک باشد ، مجبور می شود از یک فضای متقاطع انگلیسی محور استفاده شود. این امر می تواند در کیفیت فضای متقاطع مورد استفاده به دلیل کیفیت بد بالقوه نقشه برداری بین زبانهای مختلف از نظر نوع شناسی ، مانند زبانهای اورال و هند و اروپایی کاهش یابد (Artetxe و همکاران ، 2017).

3. 1 تعاریف

اجازه دهید L = L1، ... ، ل|l |>مجموعه ای از زبانهای در نظر گرفته شده ، f = f1، ... ، f|f |>مجموعه ای از خانواده های زبان ، و s = l ∪ f = s1، ... ، S|F |+|l |>مجموعه ای از فضاهای زبانی ممکن. بگذارید x l ∈ R v l × d مجموعه ای از تعبیه های کلمه در زبان l باشد ، جایی که vسعادتواژگان L و D تعداد ابعاد هر تعبیه است. t را به عنوان یک درخت خانوادگی زبان در نظر بگیرید (نمونه ای در شکل 1). گره های موجود در T نشان دهنده فضاهای زبانی در S است ، در حالی که هر لبه نشان دهنده تحول بین دو گره متصل به آن است - یعنی ، W S A ← S B ∈ R D × D به تبدیل از فضا اشاره داردشرحبه فضا sآبشربرای سهولت نماد ، ما به W S A ← * S B به عنوان thetransformation مراجعه می کنیم که ناشی از تجمع همه تحولات در مسیر استشرحبه Sآ، با استفاده از محصول DOT:

W S A ← * S B = W S A ← S T 1 W S T 1 ← S T 2 W S T 2 ← S B

جایی که مسیر از S به S استشرحS A ، S T 1 ، S T 2 ، S B u2060 ؛S T 1 و S T 2 فضاهای میانی بین S هستندآو sشرح.

سرانجام ، P مجموعه ای از واژگان دو زبانه است ، جایی که P L 1 ، L 2<0 , 1>V L 1 × V L 2 یک واژگان دو زبانه با جفت های کلمه به زبان L است1و من2بشرp l 1 ، l 2 (i ، j) = 1 اگر کلمه i از v l 1 و کلمه j th v l 2 تراز شده باشد ، p l 1 ، l 2 (i ، j) = 0 در غیر این صورت.

مثال.

مجموعه تعبیه های انگلیسی x را در نظر بگیریددر، تحولی که تعبیه شده در فضای انگلیسی را به فضای خانواده زبان آلمانی تبدیل می کند w s g e ← * s e n u2060 ، و تعبیه های انگلیسی به فضای آلمانی w s g e ← * s e n x e n u2060 تبدیل شده است. hceg آن را به گونه ای می سازد که w s g e ← * s e n x e n و w s g e ← * s d e x d e (تعبیه های تبدیل شده انگلیسی و آلمانی) در همان فضای جاسازی آلمانی قرار دارند ، در حالی که w s i n ← * s e n x e n و w s i n ← *S E S X E S (تعبیه های تبدیل شده انگلیسی و اسپانیایی) در همان فضای تعبیه هند و اروپایی قرار دارند.

در بقیه این بخش ما HCEG را با جزئیات شرح می دهیم. مقادیر داده شده به هر هیپرپارامتر ذکر شده در این بخش در بخش 4. 4 تعریف شده است.

3. 2 تعبیه عادی سازی

هنگام برخورد با تعبیه شده از منابع و زبانهای مختلف ، عادی سازی آنها مهم است. برای انجام این کار ، HCEG یک توالی عادی سازی را نشان می دهد که مفید است (Artetxe و همکاران ، 2018) ، که شامل عادی سازی طول ، میانگین مرکزیت و عادی سازی طول دوم است. عادی سازی طول آخرین طول اجازه می دهد تا شباهت كسین را به صورت كارآمدتر محاسبه كنید ، و با توجه به اینکه تعبیه ها از طول واحد هستند ، محاسبه شباهت كسین به یك محصول DOT را ساده تر می كند.

3. 3 جفت کلمه

به منظور تولید فضای تعبیه متقاطع ، HCEG به مجموعه ای از کلمات تراز شده در زبان های مختلف نیاز دارد. هنگام استفاده از HCEG به روشی تحت نظارت ، P می تواند هر منبع موجود متشکل از واژگان دو زبانه باشد ، مانند مواردی که در بخش 4. 1 شرح داده شده است. با این حال ، بهترین مزیت استراتژی پیشنهادی هنگام استفاده از تکنیک های القاء واژگان بدون نظارت ، به عنوان آنها امکان تولید واژگان ورودی را برای هر جفت از زبان مورد نیاز فراهم می کند. بر خلاف استراتژی های سل/MP که فقط می توانند از سیگنال هایی که شامل زبان محوری است ، استفاده کنند ، HCEG می تواند از سیگنال در تمام ترکیبات زبانها استفاده کند. به عنوان مثال ، یک مدل TB/MP که در آن انگلیسی محور است ، فقط می تواند از واژگان تشکیل شده از کلمات انگلیسی استفاده کند. در عوض ، HCEG می تواند از واژگان دو زبانه از زبانهای دیگر ، مانند اسپانیایی-پرتغالی یا اسپانیایی-هلندی سوء استفاده کند ، که در صورت استفاده از درخت زبان در شکل 1 ، آموزش W S I T ← S E S u2060 ، W S I T ← S P T و W S I T ← S E S را تقویت می کند.u2060 ، W S I N ← S I T u2060 ، W S I N ← S G E u2060 ، W S G E ← S D U u2060.

هنگام استفاده از HCEG در حالت بدون نظارت ، P باید به طور خودکار استنباط شود. با این حال ، محاسبه هر p l 1 ، l 2 ∈ P با توجه به دو ماتریس تعبیه شده یک زبانه x l 1 و x l 2 یک کار بی اهمیت نیست ، زیرا x l 1 و x l 2 در محورهای واژگان یا ابعاد تراز نمی شوند. Artetxe و همکاران..سعادتبرای تولید یک تراز اولیه p l 1 ، l 2 u2060:

m l = s o r t e d (x l x l ⊤)

در کجا به آن x داده می شودسعادتطول نرمال شده است ، و x l x l ⊤ یک ماتریس ابعاد را محاسبه می کندسعادت× Vسعادتدر هر سطر شباهت های کنجنی کلمه مربوطه را با توجه به تمام تعبیه های کلمه دیگر تعبیه می کند. مقادیر موجود در هر سطر سپس برای تولید بازنمایی توزیع از هر کلمه طبقه بندی می شوند که در یک مورد ایده آل که فرض ایزومتری کاملاً دارای زبان است ، زبان آگنوستیک خواهد بود. با استفاده از بازنمودهای تعبیه شده M L 1 و M L 2 u2060 ، P L 1 ، L 2 را می توان با اختصاص هر کلمه ای که شبیه ترین نمایش آن به عنوان جفت آن است ، محاسبه شود ، یعنی P L 1 ، L 2 (I ، J) = 1if:

j = arg max 1 ≤ j ≤ v l m l 1 (i ، *) m l 2 (j ، *) ⊤ جایی که m l 1 (i ، *) ردیف i از m l 1 و m l 2 (j ، *) ردیف j th m l 2 است.

نتایج در Artetxe و همکاران.(2018) نشان می دهد که این فرض به اندازه کافی قوی است که بتواند تراز اولیه را در بین زبانها ایجاد کند. با این حال ، همانطور که در بخش 3. 3 نشان می دهیم ، کیفیت این نوع تراز اولیه به زبانهای مورد استفاده بستگی دارد ، و این باعث می شود که این اولیه برای زبانهایی که از نظر تایپولوژیکی خیلی دور از یکدیگر هستند ، کاربردی نباشد - بیانیه ای که توسط Artetxe و همکاران نیز تکرار شده است.(2018) و Søgaard و همکاران.(2018).

برای اطمینان از اولیه سازی قوی تر ، ما استراتژی ارائه شده در Artetxe و همکاران را تقویت می کنیم.(2018) با معرفی یک سیگنال جدید بر اساس فرکانس استفاده از کلمات. لین و همکاران.(2012) دریافت که کلمات برت ر-2 متداول تمایل دارند که در زبان های مختلف سازگار باشند. با انگیزه از این نتیجه ، ما اندازه گیری می کنیم که رتبه بندی فرکانس کلمات در بین زبانها تا چه اندازه ارتباط دارد. همانطور که در شکل 2 نشان داده شده است ، رتبه بندی کلمات فرکانس به شدت در بین زبانها ارتباط دارد ، به این معنی که کلمات محبوب بدون توجه به زبان تمایل به محبوبیت دارند. ما از این رفتار سوء استفاده می کنیم تا فضای جستجوی معادله (3) را به شرح زیر کاهش دهیم:

j = arg max j - t ≤ j ≤ j + t m l 1 (i ، *) m l 2 (j ، *) ⊤

جایی که t مقداری است برای تعیین پنجره جستجو استفاده می شود. توجه داشته باشید که ما تعبیه ها را در هر ماتریس X فرض می کنیمسعادتبه ترتیب صعودی فرکانس طبقه بندی می شوند ، یعنی تعبیه در ردیف اول ، شایع ترین کلمه زبان l را نشان می دهد. جدا از بهبود کیفیت کلی واژگان استنباط شده (به بخش 5. 1 مراجعه کنید) ، شامل یک جستجوی مبتنی بر رتبه بندی فرکانس به عنوان بخشی از اولیه سازی ، زمان محاسبه مورد نیاز را کاهش می دهد زیرا فضای جستجو به طور قابل توجهی کاهش می یابد.

شکل 2:

Distributions of word rankings across languages. The coordinates of each dot (representing a word pair) are determined by the position in the frequency ranking the word pair in each of the languages. Numbers are written in thousands. Scores computed using FastText embedding rankings (Grave et al., 2018) and MUSE crosslingual pairs (Coeau et al., 2017). Pearson’s correlation (ρ) computed using the full set of word pairs, figures generated using a random sample of 500 word pairs for illustration purposes.

توزیع رتبه بندی کلمات در زبان ها. مختصات هر نقطه (نمایانگر یک جفت کلمه) با موقعیت در فرکانس رتبه بندی کلمه جفت در هر یک از زبانها تعیین می شود. اعداد در هزاران نفر نوشته شده است. نمرات محاسبه شده با استفاده از رده بندی های جاسازی شده FastText (Grave et al. ، 2018) و جفت های Crosslingual Muse (Coeau et al. ، 2017). همبستگی پیرسون (ρ) با استفاده از مجموعه کامل جفت های کلمه محاسبه می شود ، شکل های تولید شده با استفاده از یک نمونه تصادفی از 500 جفت کلمه برای اهداف تصویر.

شکل 2:

Distributions of word rankings across languages. The coordinates of each dot (representing a word pair) are determined by the position in the frequency ranking the word pair in each of the languages. Numbers are written in thousands. Scores computed using FastText embedding rankings (Grave et al., 2018) and MUSE crosslingual pairs (Coeau et al., 2017). Pearson’s correlation (ρ) computed using the full set of word pairs, figures generated using a random sample of 500 word pairs for illustration purposes.

توزیع رتبه بندی کلمات در زبان ها. مختصات هر نقطه (نمایانگر یک جفت کلمه) با موقعیت در فرکانس رتبه بندی کلمه جفت در هر یک از زبانها تعیین می شود. اعداد در هزاران نفر نوشته شده است. نمرات محاسبه شده با استفاده از رده بندی های جاسازی شده FastText (Grave et al. ، 2018) و جفت های Crosslingual Muse (Coeau et al. ، 2017). همبستگی پیرسون (ρ) با استفاده از مجموعه کامل جفت های کلمه محاسبه می شود ، شکل های تولید شده با استفاده از یک نمونه تصادفی از 500 جفت کلمه برای اهداف تصویر.

3. 4 عملکرد هدف

بر خلاف توابع عینی سنتی که به طور همزمان یک ماتریس تحول را برای دو زبان بهینه می کنند ، هدف HCEG این است که همزمان مجموعه ای از همه ماتریس های تحول را بهینه سازی کند به گونه ای که عملکرد ضرر به حداقل می رسد:

arg min w l ترکیبی خطی از سه ضرر مختلف است: L = β 1 × L A L I G N + β 2 × L O R T H + β 3 × L R E G

تراز کردنتا حدی که جفت های آموزشی را تراز می کنند ، سنج می کند. این کار با محاسبه مجموع شباهت كسین در بین همه جفت های كلمات در P انجام می شود:

l a l i g n = - ∑ p l 1 ، l 2 ∈ P p l 1 ، l 2 (w s l 1 ، l 2 ^ ← * s l 1 x l 1 ⋅ w s l 1 ، l 2 ^ ← * s l 2 x l 2)

جایی که s l 1 ، l 2 ^ به فضای کمترین گره والدین مشترک برای s l 1 و s l 2 در t اشاره دارد (به عنوان مثال ، s e s ، e n ^ = s i n در شکل 1). ما دریافتیم که استفاده از S L 1 ، L 2 ^ به جای فضای موجود در گره ریشه T ، عملکرد کلی HCEG را بهبود می بخشد ، جدا از کاهش زمان لازم برای آموزش (به بخش 5. 3 مراجعه کنید).

چندین محقق ، اجرای ارتوگنومیت در ماتریس های تحول را مفید دانستند (Xing et al. ، 2015 ؛ Artetxe et al. ، 2016 ؛ Smith et al. ، 2017). این محدودیت تضمین می کند که کیفیت اصلی تعبیه ها هنگام تبدیل آنها به یک فضای متقاطع تخریب نمی شود. به همین دلیل ، ما یک محدودیت متعامد را در خود جای می دهیمهمتبه عملکرد از دست دادن ما در معادله 8 ، با من ماتریس هویت هستم.

l o r t h = ∑ w s 1 ← S 2 ∈ W ∥ I - W S 1 ← S 2 W S 1 ← S 2 ⊤ ∥ ما همچنین می دانیم که شامل یک اصطلاح منظم در ℒ: l r e g = ∑ w s 1 ← S 2 ∈ W ∥ w S 1 ← S 2 ∥ 2

3. 5 یادگیری پارامترها

HCEG از نزول شیب تصادفی برای تنظیم پارامترها در W با توجه به جفت های کلمه آموزشی در صفحه استفاده می کند. در هر تکرار ، به منظور تنظیم هر ماتریس تحول در W محاسبه و بازپرداخت می شود به طوری که ℒ به حداقل می رسد. از دسته بندی برای کاهش بار محاسباتی در هر تکرار استفاده می شود. دسته ای از جفت های کلمه p ^ با انتخاب تصادفی α از p نمونه برداری می شودکلهجفت زبان و همچنین αدستگیرهجفت های کلمه در هر p ^ l 1 ، l 2 ∈ P ^ - برای مثال ، یک دسته ممکن است از 10 p ^ l 1 ، l 2 ماتریس باشد که هر کدام حاوی 500 کلمه تراز هستند.

تکرارها به دوره های α گروه بندی می شوندتکرارتکرارها در انتهای آن ℒ برای کل p محاسبه می شود. ما به عنوان معیار همگرایی یک رویکرد محافظه کارانه را اتخاذ می کنیم. در صورت عدم پیشرفت در ℒ در آخرین αترغیب کردندوره ها ، حلقه آموزش متوقف می شود.

ما به بهترین زمان همگرایی می رسیم که هر W S 1 ← S 2 ∈ W را به صورت متعامد به دست می آوریم. ما چندین روش را برای اولیه سازی متعامد ، مانند اولیه سازی به ماتریس هویت ، امتحان کردیم. با این حال ، ما با استفاده از اولیه سازی نیمه عادی تصادفی که توسط Saxe و همکاران معرفی شده است ، نتایج مداوم به دست آوردیم.(2013).

3. 6 پالایش تکراری

همانطور که توسط Artetxe و همکاران نشان داده شده است.(2017) ، واژگان اولیه P با استفاده از فضای متقاطع تولید شده برای استنباط یک واژگان جدید P ′ در پایان هر مرحله یادگیری که در بخش 3. 5 شرح داده شده است ، به طور تکراری بهبود می یابد. به طور خاص تر ، هنگام محاسبه هر p l 1 ، l 2 ′ ∈ P ′ u2060 ، p l 1 ، l 2 ′ (i ، j) 1 (در غیر این صورت) اگر در غیر این صورت)

j = arg max j w s l 1 ، l 2 ^ ← * s l 1 x l 1 (i ، *) ⋅ (w s l 1 ، l 2 ^ ← * s l 2 x l 2 (j ، *)) ⊤

به طور بالقوه ، هر واژگان دو زبانه جدید P L 1 ، L 2 stugn می تواند استنباط شود و در پایان هر مرحله یادگیری در P ′ گنجانده شود. با این حال ، با افزایش کاردینال بودن L ، این فرایند می تواند مدت زمان ممنوع انفجار ترکیبی را به خود اختصاص دهد. بنابراین ، در عمل ، ما فقط به دنبال معیاری که برای به حداکثر رساندن کیفیت واژگان در نظر گرفته شده است ، فقط P L 1 ، L 2 را استنباط می کنیم. P L 1 ، L 2 ′ برای زبانهای L استنباط می شود1و من2فقط اگر L1و من2خواهران و برادران در T هستند (آنها گره والدین یکسانی دارند) یا L1و من2بهترین نمایندگان خانواده مربوطه خود هستند. در صورتی که این زبان متداول ترین 2 زبان در زیر شبکه خود باشد ، یک زبان بهترین نماینده خانواده خود تلقی می شود. به عنوان مثال ، در شکل 1 ، اسپانیایی بهترین نماینده برای خانواده ایتالیایی است ، اما نه برای هند و اروپایی ، که از آن انگلیسی استفاده می شود.

معیار تعیین شده نه تنها میزان زمان مورد نیاز برای استنباط P را کاهش می دهد بلکه عملکرد کلی HCEG را بهبود می بخشد. این به دلیل استفاده بهتر از خصوصیات سلسله مراتبی فضای متقاطع ما است ، فقط واژگان دو زبانه را از زبان های مربوط به نوع شناسی یا بهترین نمایندگان آنها از نظر کیفیت منابع استنباط می کند.

معیار بازیابی 3. 7

همانطور که در بخش 2 مورد بحث قرار گرفت ، یکی از موضوعاتی که در بازیابی نزدیکترین همسایه قرار دارد ، Hubness است (دینو و همکاران ، 2014) ، جایی که کلمات خاصی در اطراف تعداد غیر طبیعی بسیاری از کلمات دیگر قرار دارند و باعث می شود الگوریتم نزدیکترین همسایه به طور نادرست باشدکلمات هاب را در اولویت قرار دهید. برای پرداختن به این مسئله ، ما از مقیاس بندی محلی شباهت متقابل (CSL) (Coeau et al. ، 2017) به عنوان الگوریتم بازیابی در زمان آموزش و زمان پیش بینی استفاده می کنیم. CSL ها اصلاح برای بازیابی نزدیکترین همسایه است که با تعادل در تعادل شباهت بین دو تعبیه شده توسط عاملی که از شباهت متوسط هر تعبیه شده با K نزدیکترین همسایگان خود جلوگیری می کند ، از توطئه جلوگیری می کند. به دنبال معیارهای موجود در Coeau و همکاران.(2017) ، ما تعداد همسایگان مورد استفاده CSL را به K = 10 تنظیم کردیم.

4 چارچوب ارزیابی

ما در زیر ارزیابی ارزیابی مورد استفاده برای انجام آزمایشات ارائه شده در بخش 5 را شرح می دهیم.

4. 1 مجموعه داده های جفت کلمه

Dinu-Artetxe. مجموعه داده های Dinu-Attretxe ، ارائه شده توسط Dinu و همکاران.(2014) و توسط Artetxe و همکاران تقویت شده است.(2016) ، یکی از اولین معیارهای ارزیابی تعبیه های متقاطع است. این مجموعه از واژگان دو زبانه انگلیسی محور برای ایتالیایی ، اسپانیایی ، آلمانی و فنلاندی تشکیل شده است.

در فکر فرو رفتن.

مجموعه داده Muse (Coeau et al. ، 2017) حاوی واژگان دو زبانه برای همه ترکیبات آلمانی ، انگلیسی ، اسپانیایی ، فرانسوی ، ایتالیایی و پرتغالی است. علاوه بر این ، این شامل جفت های کلمه ای برای 44 زبان با توجه به انگلیسی است.

پانکس

Dinu-Artetxe و Muse هر دو مجموعه داده انگلیسی محور هستند ، با توجه به اینکه بیشتر (اگر نه همه) جفت های کلمه خود دارای انگلیسی به عنوان منبع یا زبان هدف خود هستند. این امر باعث می شود مجموعه داده ها به منظور تولید و ارزیابی یک فضای متقاطع محور غیر زبانی ، زیر حد مطلوب باشند. به همین دلیل ، ما یک مجموعه داده را با استفاده از Panlex (کامولز و همکاران ، 2014) ، یک پایگاه داده واژگانی panlingual ایجاد کردیم. این مجموعه داده (که در مخزن ما عمومی ساخته شده است) شامل واژگان دو زبانه برای همه ترکیبات 157 زبان است که FastText در دسترس است ، در مجموع 24492 واژگان دو زبانه. هر یک از واژگان با نمونه گیری از کلمات 5K به طور تصادفی از کلمات بالای 200K در مجموعه جاسازی شده برای زبان منبع تولید شد و آنها را با استفاده از پایگاه داده Panlex به زبان هدف ترجمه کرد. ما می دانیم که این مجموعه داده با توجه به اینکه Panlex به روش اتوماتیک تولید می شود ، حاوی نویز قابل توجهی بیشتر از سایر مجموعه داده ها است و به اندازه مجموعه داده های قبلی توسط انسان ها به اندازه ریز و درشت نیست. ما هنوز هم مقایسه هایی را با استفاده از این نمایشگاه مجموعه داده می یابیم ، با توجه به اینکه ماهیت پر سر و صدا آن باید به طور یکسان بر همه استراتژی ها تأثیر بگذارد.

4. 2 انتخاب زبان و درخت خانوادگی

همانطور که قبلاً گفته شد ، ما قصد داریم یک فضای متقاطع واحد را برای هرچه بیشتر زبانها تولید کنیم. ما با 157 زبان شروع کردیم که تعبیه FastText در دسترس است (Grave et al. ، 2018). سپس ما زبانهایی را حذف کردیم که هر دو معیار زیر را رعایت نکردیم: (1) باید یک واژگان دو زبانه با حداقل 500 جفت کلمه برای زبان در هر یک از مجموعه داده های شرح داده شده در بخش 4. 1 وجود داشته باشد ، و (2) مجموعه تعبیه ارائه شدهتوسط FastText باید حداقل 20K کلمه داشته باشد. معیار اول شرط حداقل برای ارزیابی است ، در حالی که مورد دوم برای استراتژی اولیه سازی بدون نظارت ضروری است. معیارها توسط 107 زبان رعایت می شود ، که مواردی هستند که در آزمایشات ما استفاده می شوند. کدهای مربوط به ISO-639 آنها را می توان بعداً در جدول 5 مشاهده کرد. ما از درخت خانواده زبان تعریف شده توسط لوئیس و گری (2015) استفاده می کنیم.

4. 3 چارچوب

برای اهداف تجربی ، هر مجموعه داده شرح داده شده در بخش 4. 1 به مجموعه های آموزش و آزمایش تقسیم می شود. ما از تقسیمات تست اصلی قطار برای Dinu-Artetxe و Muse استفاده می کنیم. برای Panlex ، ما یک تقسیم شده به طور تصادفی جفت کلمه را ایجاد می کنیم - 80 ٪ برای آموزش و 20 ٪ باقیمانده برای آزمایش. برای اهداف توسعه و تنظیم پارامتر ، ما از مجموعه ای جدا از جفت های کلمه ای که به طور خاص برای این منظور بر اساس بانک اطلاعاتی واژگانی Panlex ایجاد شده است ، استفاده می کنیم. این مجموعه توسعه شامل 10 زبان مختلف با محبوبیت متنوع است. هیچ یک از کلمات جفت موجود در این مجموعه توسعه بخشی از مجموعه قطار یا آزمون نیستند.

آموزش استراتژی معاملاتی...
ما را در سایت آموزش استراتژی معاملاتی دنبال می کنید

برچسب : نویسنده : ملیحه نصیری بازدید : <-PostHit-> تاريخ : چهارشنبه 4 مرداد 1402 ساعت: 19:17