Table of Contents
تکامل تکنولوژی ترجمه ی قابل تحمل
مفهوم ترجمه قابل حمل جدید نیست.تلاش های اولیه شامل دستگاه های دستی متن در دهه 1990، اما آنها نیاز به ورودی دستی و واژگان محدود ارائه شده است.اولین آزمایش های ترجمه واقعا پوشیدنی با بلوتوث گوش تکه های جفت شده به تلفن های هوشمند، اما تاخیر و دقت در امروز، پوشیدنی های اختصاصی مانند و [F:2] پردازش سنسور های مبتنی بر ابر (mttle3) را بهبود داده اند.
اصول طراحی هسته برای مترجمان قابل حمل
کاربر Comfort و ارگونومی
دستگاه های ترجمه قابل حمل اغلب برای ساعت ها در طول جلسات تجاری، مسافرت یا تعاملات اجتماعی استفاده می شوند.ساخت و ساز سبک پزشکی، به طور معمول با استفاده از سیلیکون درجه پزشکی یا پوسته های پلی کربنات، کاهش منافذ گوش قابل تنظیم، چندین اندازه گوش و یا خطوط ارگونومیک اطمینان از یک مناسب بدون فشار برای عینک های هوشمند، توزیع وزن در سراسر بینی و پل، همچنین باید برای جلوگیری از باتری های حساب و خاموش کننده های ضد آفتاب ضروری باشد.
کیفیت صدا و سر و صدا Cancellation
ترجمه دقیق با ضبط صدای روشن آغاز می شود. A آرایه میکروفون جهت هدایت (اغلب 2 -4 میکروفون در هر گوشبود) بر صدای کاربر تمرکز می کند در حالی که فیلتر کردن سر و صدا فعال صدا (ANfiC) برای هر دو ورودی و خروجی کمک می کند تا کاربر به وضوح ترجمه را حتی در کافه های شلوغ یا دستگاه های تجاری نشان دهد که به طور چشمگیری از طریق صدای زنگ زدن صدا استفاده می کنند.
نمایش و مکانیسم های بازخورد
برای عینک های هوشمند، ترجمه می تواند به عنوان واقعیت افزوده در زمینه دید کاربر ظاهر شود، این نیاز به نمایش های مشاهده با روشنایی قابل تنظیم و کنتراست به کار در شرایط مختلف نور صوتی، برخی از طرح ها استفاده از میکروارگانیسم های تککروم OLED پیش بینی شده بر روی لنز، در حالی که دیگران استفاده از اپتیک موج برای دستگاه های صوتی، فقط صدا، بازخورد کاربر (کنترل های صوتی یا سیگنال لمسی، دستورات صوتی، پیام کوتاه).
معماری تکنولوژی
میکروفون و تشخیص فعالیت صوتی
قرار دادن میکروفون بسیار مهم است. اکثر پوشیدنی ها از یک آرایه پرتو سازی برای جدا کردن صدای پوشنده از چت پس زمینه استفاده می کنند.یک آشکارساز فعالیت صوتی کم قدرت (VAD) تنها زمانی که گفتار تشخیص داده می شود، حفظ باتری، صدا در 16 کیلوهرتز یا بالاتر و فشرده با استفاده از کدک مانند Opus قبل از انتقال نمونه شده است.
پردازش و موتور ترجمه
ترجمه می تواند بر روی دستگاه، در ابر یا از طریق یک رویکرد هیبریدی رخ دهد. On- Device Models (به عنوان مثال، با استفاده از واحد پردازش Tensor گوگل یا موتور AI Qualcomm) تاخیر را کاهش می دهد، اما محدود به حافظه و باتری مدل های توجه بالا و پوشش زبان گسترده تر اما نیاز به سیستم های اینترنتی پایدار دارند.
Wireless Connectivity
Blue 5.2tooth استاندارد برای جفت کردن با تلفن، پشتیبانی از جریان صوتی کم صدا، برخی از دستگاه ها همچنین شامل Wi-Fi 6 برای دسترسی مستقیم ابر بدون واسطه تلفن همراه است.
مدیریت قدرت
عمر باتری یک شکایت کاربر بالا است. استقامت تک نفره 4 تا 6 ساعت معمول است؛ موارد شارژ تا 20 تا 30 ساعت استفاده می شود. اجزای برق-هونگری شامل رادیو بی سیم (به ویژه فعال Wi-Fi)، پردازنده هوش مصنوعی و صفحه نمایش (برای عینک) حالت های خواب تهاجمی را به کار می گیرند: دستگاه وارد خواب عمیق می شود، زمانی که هیچ سخنرانی برای 30 ثانیه شناسایی شده و از بین می رود.
آدرس های کلیدی Challenges
Dialect و Accent Robustness
مدل های تشخیص گفتار باید در لهجه ها و گویش های مختلف آموزش داده شوند تا از شکست در استفاده از دنیای واقعی جلوگیری کنند، به عنوان مثال، دستگاهی که در درجه اول در انگلیسی آمریکایی آموزش دیده است ممکن است با توسعه دهندگان اسکاتلندی یا هندی مبارزه کند تا این کار را با جمع آوری داده های گفتاری از صدها نوع منطقه ای و استفاده از استخراج ویژگی های تشخیص داده شده (با اجازه کاربر) امکان می دهد تا دستگاه در طول زمان سازگار شود.
عدم صلاحیت و طبیعی بودن تعامل
کاربران انتظار دارند که ترجمه نزدیک به فرد، هر تاخیر بیش از 500 میلی ثانیه جریان مکالمه را مختل کند. دستیابی به تأخیر پایین نیاز به بهینه سازی هر مرحله دارد: ضبط صوتی، VAD، شبکه، استنتاج ترجمه و سنتز گفتار، محاسبات لبه (به عنوان مثال، یک شبکه عصبی که در حال اجرا بر روی یک NPU اختصاصی در داخل پوشیدنی است) می تواند زمان گرد و بسته را کاهش دهد.
حریم خصوصی و امنیت داده ها
مترجمان پوشیدنی مکالمات حساس را پردازش می کنند.نگرانی های حریم خصوصی حاد هستند، به ویژه در تنظیمات تجاری یا حقوقی بهترین شیوه ها عبارتند از: پردازش سخنرانی به طور کامل بر روی دستگاه در صورت امکان؛ رمزگذاری تمام داده ها در حمل و نقل؛ ارائه جریان های رضایت کاربر روشن؛ و ارائه یک "حالت حریم خصوصی" که باعث کاهش ابر می شود، میکروفون باید یک سوئیچ فیزیکی یا نشانگر نور داشته باشد.
زندگی باتری در مقابل معامله عملکرد
مدل های ترجمه با دقت بالا نیاز به قدرت محاسباتی قابل توجه دارند که باتری ها را تخلیه می کند. کاربران باید بین استفاده گسترده یا کیفیت بالا انتخاب کنند. طراحان می توانند پروفایل های کیفیت قابل تنظیم (به عنوان مثال، حالت “اقتصادی” از یک مدل کوچکتر و دقیق تر استفاده کنند) روش دیگر: حذف نفوذ سنگین به یک گوشی هوشمند جفت، کاهش قدرت پوشیدنی در هزینه افزایش مصرف باتری.
ویژگی های Agent Constraints
عینک های هوشمند فضای محدودی برای دکمه ها، باتری ها و آنتن ها دارند. عینک های هوشمند باید اپتیک، الکترونیک و زیبایی شناسی را متعادل کنند. یک معبد بزرگ ممکن است با لنزهای تجویزی تداخل داشته باشد یا باعث ناراحتی شود. طرح های آینده ممکن است از PCB های انعطاف پذیر و سلول های باتری انباشته شده برای متناسب با اجزای پروفایل های باریک استفاده کنند.
مسیر های آینده
واقعیت افزوده Overlays
نسل بعدی عینک های هوشمند ترجمه ها را به طور مستقیم به میدان بصری کاربر با ثبت فضایی دقیق جاسازی می کنند، به عنوان مثال، هنگامی که به یک علامت زبان خارجی نگاه می کنیم، دستگاه می تواند متن ترجمه شده را دقیقاً جایی که اصلی به نظر می رسد، اضافه کند.این نیاز به SLAM] (Simult Localization and Mapping) و شناخت واقعی (LCR) دارد.
ادغام رابط Brain- computer
سیستم های تجربی تلاش می کنند تا سخنرانی زیرکال را ترجمه کنند – کاربر کلمات را می پندارد اما هنوز با صدای بلند صحبت نمی کند. سنسورهای الکترونفالوگرام (EEG) در یک سربند یا گوش، سیگنال های عصبی مربوط به سخنرانی خاموش را تشخیص می دهند، در حالی که هنوز هم در تحقیقات اولیه (به عنوان مثال پروژه های MIT و آزمایشگاه های واقعیت فیس بوک) چنین تکنولوژی می تواند بدون صدا، ایده آل سازی برای کاربران ساکت یا اختلالات گفتاری، ترجمه را فعال کند.
تفسیر همزمان زمان واقعی
پوشیدنی های فعلی بین گوش دادن و صحبت کردن، مانند یک تفسیر همزمان واقعی (جایی که کاربر ترجمه را می شنود در حالی که سخنران ادامه می دهد) طبیعی تر است.این نیاز به کانال های صوتی جداگانه و پردازش پیچیده دواural برای جلوگیری از سردرگمی دارد.
ترجمه متن متن ترجمه
دستگاه های آینده در محل کاربر، موضوع گفتگو و زمینه فرهنگی فاکتور خواهند کرد.برای مثال، در یک محیط پزشکی، دستگاه ممکن است اصطلاحات پزشکی و لحن متقابل را اولویت بندی کند.در یک مذاکره تجاری، می تواند نشانه های فرهنگی (به عنوان مثال، امتناع غیرمستقیم در ژاپن) باشد.
نتیجه گیری
طراحی تکنولوژی پوشیدنی موثر برای ترجمه زبان واقعی مستلزم تعادل دقیق آرامش، وفاداری صوتی، قدرت پردازش و عمر باتری است.چالش های تنوع گویش، تاخیر و حریم خصوصی همچنان به نوآوری در حال پیشرفت هستند. AI مدل های کوچکتر و کارآمد تر [FLT 1] و به عنوان سخت افزار بدون £، این دستگاه ها قادر به توسعه موانع نرم افزار یکپارچه در آینده هستند.