טקסט-לדיבור (Text-to-Speech)
תמונה, קול ווידאו
טקסט-לדיבור (Text-to-Speech, TTS) היא טכנולוגיה שהופכת טקסט כתוב לקול מדובר טבעי — הבסיס לכל דבר מקורא-מסך לנגישות, ועד עוזרים קוליים ואווטארים מדברים.
מערכות TTS מוקדמות נשמעו מכניות וקטועות באופן ברור — קל היה להבחין שמדובר במחשב. מודלים מבוססי-למידה-עמוקה מודרניים מייצרים דיבור טבעי מאוד, עם אינטונציה, הדגשות, וקצב שנשמעים כמעט זהים לדיבור אנושי אמיתי.
TTS הוא רכיב מרכזי בכל אפליקציית "שיחה קולית" עם AI — אחרי שהמודל "חושב" תשובה טקסטואלית, TTS הופך אותה לקול שמושמע בזמן אמת, לעיתים תוך כדי סנכרון עם אנימציית שפתיים.