رباتی که فقط متن میخواند، بخشی از مشتریهایت را بد جواب نمیدهد؛ اصلا نمیبیند. آنها ویس فرستادهاند و هیچ اتفاقی نیفتاده است. در گزارش ربات هم ردی از آنها نیست، چون از نگاه سیستم پیامی نیامده که بشود به آن جواب داد.
در ایران بخش بزرگی از گفتوگوی کاری با ویس انجام میشود و دلیلش تنبلی نیست؛ تایپ فارسی روی گوشی کند است. پیام صوتی مشتری برای خودش سریعترین راه است، و برای تو کندترین راه خواندن. پس پیش از هر تصمیمی دربارهی ربات، یک عدد را لازم داری: از پیامهای یک ماه گذشتهات، چندتا صوتی بودهاند؟ وقتی پیامها را برای امتحان ربات مرور میکنی، کنار هر ویس یک خط بکش و آخر کار بشمار.
عدد ویسها اولویت را تعیین میکند، نه جذابیت صدا
اگر کمتر از یکی از هر ده پیامت صوتی است، صدا مسئلهی امروز تو نیست؛ برگرد و کیفیت جوابهای متنی را بهتر کن. اگر از یکسوم بیشتر است، بخش بزرگی از مشتریهایت را نمیبینی. ولی همین عدد هم بهتنهایی تصمیم نمیسازد. سه کسبوکار فرضی را ببین:
| کسبوکار | سهم ویس از پیامها | نمرهی ربات متنی در بیست پرسش | صدا اولویت است؟ |
|---|---|---|---|
| الف | از هر بیست پیام یکی | ۱۸ درست، ۲ غلط | نه؛ سراغ همان دو غلط برود |
| ب | نزدیک به نیمی | ۱۹ درست، ۱ غلط | بله؛ بهترین نامزد |
| ج | نیمی | ۱۰ درست، ۷ غلط | هنوز نه |
کسبوکار ج وسوسهانگیزترین مورد است، چون نیمی از پیامهایش صوتی است. ولی ربات متنیاش هفت جواب نادرست دارد. اگر لایهی صدا رویش سوار شود، همان هفت غلط به آدمهای بیشتری میرسد. صدا تقویتکننده است: ربات خوب را به مشتریهای بیشتری میرساند، و ربات بد را هم. ترتیب درست برای ج این است که اول غلطهای متنی را دستهبندی کند و قاعدهی سپردن به آدم را بنویسد، بعد سراغ صدا برود.
دستیار صوتی سه کار پشت سر هم است
«دستیار صوتی» یک چیز به نظر میرسد، ولی سه کار جدا را پشت سر هم انجام میدهد و هر کدام جای خودش خراب میشود:
- شنیدن: صدا به متن تبدیل میشود. اگر اینجا اشتباه شود، بقیهی زنجیره روی متن نادرست کار میکند.
- فهمیدن: همان کاری که ربات متنی میکند، این بار روی متنی که از صدا درآمده.
- گفتن: جواب دوباره به صدا تبدیل میشود.
نتیجهی مهمش این است که اگر لایهی فهمیدن را درست کرده باشی، بخش بزرگی از کار صدا هم درست شده است. برعکسش هم صادق است و مهمتر: رباتی که در متن جواب نادرست میدهد، در نسخهی صوتی همان جواب را با صدایی مطمئنتر میدهد.
چرا شنیدن فارسی سختتر است
کیفیت تبدیل صدا به متن برای فارسی معمولا از انگلیسی پایینتر است و دلیلهایش مشخصاند. لهجهها و گویشها با هم فاصله دارند و بیشتر مدلها روی دادهی محدودی آموزش دیدهاند. در گفتار «میخواهم» تقریبا هیچوقت گفته نمیشود؛ «میخوام» و «میخام» گفته میشود. نام محصولاتت، برندهایت و اصطلاحات صنفت را هیچ مدل عمومی نمیشناسد. و ویس دایرکت معمولا در خیابان، مغازه یا ماشین ضبط میشود، با صدای پسزمینه.
ده ویس واقعی، یک پاسخنامه، یک عدد
پیش از اینکه دربارهی دستیار صوتی با کسی حرف بزنی، بدان روی صدای مشتریهای خودت چقدر درست میشنود. این آزمون حدود سی و پنج دقیقه وقت میگیرد:
- ده ویس واقعی از دایرکت خودت بردار، از روزهای مختلف. عمدا چندتایی را هم بگذار که کیفیت صدایشان بد است؛ آنها هم مشتریاند.
- هر کدام را خودت گوش بده و متن درستش را بنویس. این پاسخنامهی توست.
- همان ده ویس را از یک ابزار تبدیل صدا به متن رد کن. ابزارهای متنبازی هست که روی رایانهی خودت اجرا میشوند و سرویسهای آنلاین هم هستند.
- خروجی را کنار پاسخنامه بگذار و برای هر ویس یکی از سه برچسب را بزن: کاملا درست، قابل فهم ولی با اشتباه، غیرقابل استفاده.
- برای آنهایی که اشتباه داشتند ببین اشتباه کجا بود: روی کلمههای معمولی، یا روی نام محصولات و اصطلاحات تو.
- متن خروجی سه ویس را به ربات متنی فعلیات بده و ببین چه جواب میدهد. این دقیقا همان چیزی است که یک دستیار صوتی میگفت.
خواندن نتیجه هم چهار حالت دارد. اگر هشت ویس از ده کاملا درست بود، شنیدن برای کار تو کافی است و گره جای دیگری است، احتمالا در فهمیدن. اگر چهارتا یا کمتر درست بود، هنوز سراغ دستیار صوتی نرو؛ روی متن نادرست، بهترین ربات هم جواب نادرست میدهد. اگر اشتباهها روی نام محصولات بود، خبر خوبی است: بیشتر ابزارها اجازه میدهند فهرست واژههای اختصاصیات را به آنها بدهی، و بعدش دوباره بیازمای. و اگر بیشتر ویسها پر از صدای پسزمینه بودند، بخشی از مشکل حلشدنی نیست؛ آنجا سیستم بهجای حدس زدن باید گفتوگو را به آدم بسپارد.
آزمون ششم را جدی بگیر. اگر ربات متنی روی همان سه متن جواب بد داد، مشکل صدا نیست. رایجترین اشتباه تصمیم در این حوزه همین است: پول خرج لایهی صدا میشود در حالی که لایهی فهمیدن خراب است.
ویسی که چهار پرسش در خودش دارد
مشتری در یک ویس چهل ثانیهای میگوید: «سلام، اون بستهی حرفهای رو میخواستم ببینم چنده و چقدر طول میکشه راه بیفته.» دستیار جواب میدهد: «بستهی حرفهای ۵ میلیون تومان است.» نام بسته را درست شنیده و قیمت هم درست است. پس شنیدن سالم است و گفتن هم. خرابی در فهمیدن است: ویس دو پرسش داشت و فقط به یکی جواب داده شد.
این جواب در هیچ جدول نمرهای «غلط» ثبت نمیشود، چون آنچه گفته درست است. برای همین در امتحان متنی هرگز پیدا نمیشود؛ پیام متنی معمولا یک پرسش دارد و ویس معمولا چندتا. راه حلش این است که متن پیش از پردازش به پرسشهای جدا شکسته شود، یا اگر بیش از یک پرسش تشخیص داده شد، گفتوگو به آدم برسد. و در هر آزمونی که برای صدا میگیری، چند ویس چندپرسشی بگذار.
برای پانزده پیام در روز، دستیار صوتی لازم نیست
یک مغازهی کوچک فرضی روزی حدود پانزده پیام میگیرد که نیمیشان ویس است؛ یعنی روزی حدود هفت ویس. صاحبش میپرسد دستیار صوتی بسازد یا نه. جوابش نه است، چون راه بسیار ارزانتری همان مشکل را حل میکند: فقط ویسها به متن تبدیل شوند و کنار هم در یک صندوق بیایند. صاحب مغازه هفت متن را در یک نگاه میخواند؛ کاری که با گوش دادن به هفت ویس حدود ده دقیقه طول میکشید.
این راه هیچ خطر جواب نادرستی ندارد، چون آدم جواب میدهد. همین امروز هم شدنی است. و اگر روزی حجم بالا رفت، متنها را داری؛ یعنی فهرست پرسشهای واقعی برای امتحان ربات خودبهخود ساخته شده و تصمیم بعدی را با داده میگیری، نه با حدس. برای بیشتر کسبوکارهای کوچک این نصف راه حل است با کسری از پیچیدگی، و همان کافی است.
پشت تلفن، سه چیز تازه میشکند
فرض کن دستیار متنیات آماده است: هیچ جواب ساختگی نمیدهد و قاعدهی سپردن به آدم را دارد. همان بیست پرسشی که در متن پانزده جواب درست و پنج ارجاع به آدم گرفته بود، در بیست تماس آزمایشی فرضی این نتیجه را داد:
| نتیجهی تماس | تعداد |
|---|---|
| جواب درست | ۱۱ |
| سپردن درست به آدم | ۴ |
| پرسش اشتباه شنیده شد | ۳ |
| تماسگیرنده وسط جواب قطع کرد | ۲ |
اشتباه شنیدن، مرز «نمیدانم» را دور میزند
اگر سیستم «گارانتی» را «گاراژ» بشنود، در سندها دنبال کلمهی نادرست میگردد. بدتر اینکه ممکن است چیزی هم پیدا کند و با اطمینان جوابی بیربط بدهد. مرز «نمیدانم» وقتی کار میکند که سیستم بداند نمیداند؛ اینجا فکر میکند میداند. راه حلش بازگویی است: پیش از جواب، پرسش را تکرار کند؛ «سوالتون دربارهی گارانتیه، درسته؟» تماس چند ثانیه طولانیتر میشود، ولی خطا از نامرئی به دیدنی تبدیل میشود.
جوابی که در متن کامل بود، پشت خط طولانی است
در متن، مشتری جواب بلند را با چشم مرور میکند و بخش مهمش را پیدا میکند. پشت تلفن باید تا آخر گوش بدهد. پس جواب صوتی باید با نتیجه شروع شود و توضیح بعدش بیاید: «هجده ماه. اگر بخواهید شرایطش را هم میگویم.»
«نمیدانم» پشت تلفن جور دیگری شنیده میشود
در چت، «این را در اطلاعاتم پیدا نکردم» جملهای خنثی است. در تماس، همان جمله با مکثی که پیش از آن میآید شبیه ناتوانی شنیده میشود؛ سه ثانیه سکوت یعنی «قطع شد؟». پس پشت تلفن «نمیدانم» همیشه باید با قدم بعدی بیاید: «این را باید همکارم بگوید، الان وصلتان میکنم.»
با این جدول، نسخهی پاسخگو هنوز آمادهی انتشار نیست؛ سه تماس اشتباهشنیده همان جواب ساختگیاند، فقط علتشان فرق میکند. چیزی که میشود همین حالا راه انداخت، نسخهای است که فقط غربال میکند: پرسش را بشنود، بازگو کند و بیآنکه خودش جواب بدهد تماس را به آدم وصل کند. ارزش واقعی دارد و خطر جواب نادرست ندارد، و بازگوییای که اینجا ساخته میشود همان چیزی است که بعدا برای پاسخگویی کامل لازم داری.
مرز آنچه این آزمون به تو میدهد
ساختن دستیار صوتی فارسی روی خط تلفن به زیرساخت تلفن اینترنتی و تنظیم مدل گفتار برای فارسی نیاز دارد؛ کاری تخصصی و پرهزینه. آزمون ده ویس تو را به آنجا نمیرساند. چیزی که میدهد این است که بدانی لایهی خراب تو شنیدن است یا فهمیدن، صدا اصلا اولویتت هست یا نه، و اگر روزی سفارش دادی، دقیقا چه میخواهی.
روش امتحان ربات متنی، دستهبندی غلطها و قاعدهی سپردن به آدم، که پیشنیاز هر نسخهی صوتیاند، در مینیدورهی رایگان «کارآموز شیفت شب» آمده است. برای دستیاری که روی سندهای خودت ساخته و آزموده شود، جزئیات این خدمت را ببین.