Այս էջը վերաբերում է ինչպես է խոսքը ձևավորվումկոնկատենատիվ հոլովակներ, պարամետրիկ ձայնակոդերներ, WaveNet ոճի հում աուդիո և GSpeech-ի կողմից այսօր երթուղիների նեյրոնային մոդելները: Սա «ինչու՞ նվագարկիչ ավելացնել» ցանկ չէ, որը շարունակում է գոյություն ունենալ: կայքի TTS-ի առավելություններըՍա նաև WordPress-ի տեղադրման ուղեցույց չէ։
Գործող կայքում դուք չեք ընտրում հետազոտական աշխատանք: Դուք ընտրում եք ձայն Cloud Console-ում: Այդ ընտրության դեպքում՝ Միասնական արհեստական բանականության ձայնային շարժիչ (առևտրային) կարող է օգտագործել OpenAI, Gemini, Google Cloud, Chirp3 HD, Neural2, Polyglot և WaveNet՝ API բանալիներ անհրաժեշտ չեն։ Ամպային մշակումը, սերվերի ծանրաբեռնվածության բացակայությունը սինթեզը պահում է ձեր սկզբնաղբյուրից դուրս։
Սինթեզի խողովակաշար (ի՞նչ է իրականում տեղի ունենում)
Խոսքի սինթեզ գրված տոկենները վերածում է ալիքային ձևի։ Կայքի նվագարկիչը միայն վերջին քայլն է՝ ֆայլի նվագարկում։ Հետաքրքիր աշխատանքը ավելի վաղ է։
- Տեքստը - մեկուսացված հոդված, ընդգծված span (RHT) կամ թարգմանված տող։ Մեկուսացումը արտադրանքի աշխատանք է, այլ ոչ թե ձայնակոդերի թուղթ։
- Լեզվաբանական վերլուծություն - բառեր, շեշտ, դադարներ: Խելացի արտասանության կեղծանունները այստեղ են. ապրանքանիշի տողեր, որոնք մոդելը այլապես կկռահեր:
- Ակուստիկ մոդել - կոնկատենատիվ միավորներ, պարամետրիկ ձայնակոդեր կամ աուդիո կանխատեսող նեյրոնային ցանց։
- Ալիքային ձևը դուրս է - պահվում է մեկ անգամ «Ստեղծել մեկ անգամ», «Պահպանել և նվագարկել» բաժիններում, ապա հեռարձակվում է։ Զննարկիչ speechSynthesis բաց է թողնում այս պահեստը և օգտագործում է ուղարկված օպերացիոն համակարգը։
TTS մոդելների երեք ընտանիք
Կոնկատենատիվ TTS պահպանում է խոսնակի կարճ հատվածները և վերամիավորում դրանք: Խոսնակը կամ էմոցիան փոխելը սովորաբար նշանակում է նոր տվյալների բազայի ձայնագրում: Դասական Siri ոճի կույտերն օգտագործում էին այս գաղափարը:
Պարամետրիկ TTS պահպանում է խոսքի հատկանիշները մոդելի պարամետրերում: Վաղ տարբերակները հաճախ հնչում էին ոչ այնքան բնական, որքան կոնկատենատիվը, քանի որ աուդիոն անցնում էր ձայնակոդեր.
Նեյրոնային համակարգերը կանգնած են այդ պատմության վրա։ Կանոնների վրա հիմնված և վիճակագրական կույտերը դեռևս գոյություն ունեն դասագրքերում։ GSpeech-ի առևտրային ձայներում դուք լսում եք արհեստական բանականության սինթեզ՝ OpenAI, Gemini, Google Cloud Neural2 / Polyglot / Chirp3 HD և WaveNet, այլ ոչ թե ձեր PHP հոսթի տեղական կոնկատենատիվ բանկ։
WaveNet. հում ալիքային ձևի մոդելավորում
WaveNet-ը փոխեց պարամետրիկ պատմությունը՝ կանխատեսելով աուդիո ազդանշանի նմուշը նմուշ առ նմուշ՝ կոմպակտ սպեկտրոգրամը ձայնակոդերին հանձնելու փոխարեն: Google-ի 2016 թվականի աշխատանքը ցույց տվեց, որ լայնացված կոնվոլյուցիոն ցանցը կարող է ընդգրկել հազարավոր ժամանակային քայլեր: Անմշակ աուդիոն խիտ է՝ սովորաբար 16,000 նմուշ վայրկյանում կամ ավելի, ուստի ավտոռեգրեսիվ արտադրությունը թանկ է, բայց այն որսում է շրթունքների հարվածները և բարձրախոսի առանձնահատկությունները, որոնք կոնկատենատիվ սոսինձը հաճախ բաց է թողնում:
PixelRNN և PixelCNN ցույց տվեց, որ հնարավոր է պատկեր ստեղծել մեկ ալիքով միաժամանակ։ WaveNet-ը այդ գաղափարի 1D տարբերակն է՝ լիովին ոլորուն ցանց, որի լայնացման գործոնները էքսպոնենցիալ կերպով մեծացնում են ընկալիչ դաշտը։
Մարզման ժամանակ մուտքային տվյալները իրական գրանցված ալիքաձևեր են։ Նմուշառման ժամանակ յուրաքանչյուր քայլ վերցնում է ցանցի կանխատեսված բաշխումից, վերադարձնում է այդ նմուշը և շարունակվում։ Այդ ցիկլն է պատճառը, որ վաղ WaveNet-ը միայն հետազոտական հաշվարկներ էր իրականացնում. ավելի ուշ կուտակված տվյալները այն կրճատեցին մինչև Google TTS-ի արտադրական տարբերակ։
MOS-ը և 2016 թվականի բացը
Google-ը գնահատեց WaveNet- ը այդ ժամանակվա լավագույն պարամետրիկ և կոնկատենատիվ համակարգերի դեմ՝ օգտագործելով Կարծիքի միջին միավորներ (MOS) - կույր մարդկանց գնահատականներ (սկզբնական զեկույցում 100 թեստային նախադասությունների վրա ավելի քան 500 գնահատական): WaveNet-ը այդ թեստերում մարդկային խոսքի հետ մնացած տարբերությունը կրճատել է ավելի քան կեսով ամերիկյան անգլերենի և մանդարին չինարենի համար: Սա հետազոտական նշանակալի նվաճում է, այլ ոչ թե GSpeech մարքեթինգային գնահատական:
WaveNet-ը Unified AI Voice Engine-ի մեկ ընտանիք է: Ավելի ուշ կուտակումները՝ Երկվորյակների TTS, Chirp3 HD, Neural2, Polyglot և OpenAI - դրանք այն են, ինչ դուք ընտրում եք որպես ձայն Cloud Console-ում: Դուք չեք տեղակայում WaveNet ստուգիչ կետ WordPress-ում:
Gemini TTS: արագ կառավարվող խոսք
WaveNet-ը կանխատեսեց հաջորդ աուդիո նմուշը։ Երկվորյակների TTS Google-ի խոսքի ստեղծման ավելի ուշ ուղի է. դուք նկարագրում եք, թե ինչպես պետք է հնչի ընթերցվածը բնական լեզվով՝ ոճ, առոգանություն, տեմպ, տոն, հույզեր, արտասանություն, և մոդելը կատարում է այդ ուղղությունը: Ահա թե ինչու GSpeech-ը հատուկ ձայնային հուշումներ և Ձայնային թրթռումներ (ոճերը, ոչ թե լրացուցիչ ձայնային նույնականացուցիչները) կարևոր են Gemini-ի վրա. կառավարումը գտնվում է հուշման մեջ, այլ ոչ թե նոր կոնկատենատիվ բանկում։
Լեզվական մաքրումը դեռևս տեղի է ունենում նախ: Smart Pronunciation Aliases-ը կարող է ընդլայնել հապավումը կամ ամրագրել ապրանքանիշի տոկենը. Gemini-ն այնուհետև արտասանում է պատրաստված տողը՝ պահանջվող փոխանցմամբ: Պաշտոնական API-ի նշումներ. Երկվորյակների TTS.
Ամենաբարձր ճշգրտությամբ Երկվորյակների պատմություն, երբ լսելու անցագիրը էջի մաս է կազմում. գլխավոր գրառումներ, ապրանքանիշի բացատրություններ, ապրանքի տեքստ։
Նույն հուշումների լեզուն, ինչ Pro-ն, կարգավորված գրառումների կամ SKU-ների կատալոգում ավելի արագ ստեղծման համար։
Gemini Pro
Gemini Pro GSpeech-ի ներսում առկա գերիրատեսական Gemini TTS մոդելն է: Դուք գրում եք հատուկ ձայնային հուշում այնպես, ինչպես կհուշեիք պատմողին. ավելի հանգիստ ապրանքի բացատրություն, ավելի պայծառ բլոգ, ավելի խիստ առոգանություն, ավելի դանդաղ տեմպ, ավելի շատ հույզեր: Տեսանելի HTML-ը մնում է մաքուր ընթերցողների և SEO-ի համար: Չկա առանձին Gemini բանալի, չկա Google AI Studio նախագիծ, չկա լրացուցիչ մատակարարի կոնսոլ:
Տեխնիկապես սա դեռևս ամպային սինթեզ է, ապա՝ պահված ֆայլ։ Կրկնվող լսումները վերարտադրություն են, այլ ոչ թե նոր Gemini-ի երկկողմանի ուղևորություն։ Օգտագործեք Pro, երբ աուդիոն է փորձառությունը՝ գլխավոր հոդված կամ ապրանքի էջ, որտեղ առաքումը պետք է ուղղված լինի, այլ ոչ թե ընդհանուր։
Gemini Flash
Gemini Flash Նույն Gemini TTS ընտանիքն է, որը մշակված է արագության համար: Հուշող բառապաշարը համապատասխանում է Pro-ին (ոճ, առոգանություն, տեմպ, տոն, հույզեր, արտասանություն), այնպես որ կարող եք մեկ անգամ նախագծել ձայնային ուղղությունը և վերօգտագործել այն, մինչդեռ Flash-ը ավելի արագ է թերթում էջերը: Կատալոգի աշխատանքային ուժ. բազմաթիվ գրառումներ, WooCommerce նկարագրություններ, բազմալեզու նախագծեր: Առաջ մղեք գլխավոր URL-ը Pro-ում, երբ ցանկանում եք ունենալ աշխատանքի վերջին մասը:
Chirp3 HD: Google Cloud’s current HD neural family
Chirp3 HD «WaveNet-ը նոր անունով չէ»: WaveNet-ը (2016) մոդելավորել է հում աուդիոն լայնացած գալարներով: Neural2, Polyglot և WaveNet ձայները դեռևս գտնվում են Google Cloud կատալոգում (the 230+ հարկ՝ Standard, WaveNet, Neural2, Polyglot, Journey, Studio, News): Chirp3 HD-ն Google-ի ավելի ուշ շրջանի բարձր թույլտվությամբ Cloud TTS սերունդն է՝ կառուցված ռեալիզմի և բնական ինտոնացիայի համար, այլ ոչ թե հարթ բարձրաձայն ընթերցման համար: Պաշտոնական նշումներ՝ Չիրփ 3 HD.
GSpeech-ի ներսում Chirp3 HD-ն Cloud Console ձայն է. ոչ մի Google Cloud նախագիծ, ոչ մի ծառայության հաշվի JSON: Դուք եք ընտրում ձայնը. սինթեզը կատարվում է ձեր սկզբնաղբյուրից. ֆայլը պահվում և նվագարկվում է Full Page, Button, Circle, Floating, Context կամ RHT միջերեսներով: Արագությունը և տոնայնությունը մնում են կոնսոլում: Ապրանքանիշերի անունները դեռևս պատկանում են Smart Pronunciation Aliases-ին. այդ շերտը անկախ է նրանից, թե որ Google ընտանիքն եք ընտրել:
Երբ ընտրել Chirp3 HD-ն Gemini-ի դեմ. Chirp3 HD-ն, երբ ցանկանում եք Google Cloud HD-ի արտադրական նեյրոնային որակ և սարքից անկախ հետևողական ընթերցում: Gemini Pro / Flash-ը, երբ ցանկանում եք բնական լեզվով արագ վերահսկողություն ոճի և հույզերի նկատմամբ: Երկուսն էլ առևտրային Unified AI Voice Engine ուղիներ են: Շարժիչի ընդհանուր արժեքը կազմում է 300+ ձայն վրայով 98 լեզու (Gemini ~30 × 3 Chirp 3 HD, Flash և Pro լեզուների համար, գումարած OpenAI 11 × 2, գումարած Google Cloud կատալոգը): Voice Vibes-ները ոճեր են, այլ ոչ թե լրացուցիչ ID-ներ:
- Նեյրալ2 - լայնորեն օգտագործվող արտադրական նեյրոնային ձայներ նույն Google Cloud կատալոգում։
- Բազմալեզու - ավելի ուժեղ բազմալեզու / միջլեզվային կատարողականություն։
- WaveNet- ը - 2016 թվականի հում ալիքաձևերի ընտանիքը, որը դեռևս հասանելի է որպես կատալոգային ձայներ, ոչ թե միակ Google ուղին։
Միասնական արհեստական բանականության ձայնային շարժիչը ընդդեմ բրաուզերի TTS-ի
Սարք speechSynthesis տեղական API է: Ձայները տարբերվում են օպերացիոն համակարգից կախված: Ֆայլը «Միանգամից ստեղծել, պահել և նվագարկել» գործառույթ չկա, CMS պատճենի փոփոխության դեպքում Smart Audio Sync գործառույթ չկա, և Voice Vibes հուշման շերտ չկա: GSpeech Cloud Processing-ը մոդելը գործարկում է ամպում, պահպանում է ֆայլը, և վիջեթը նվագարկում է այն: Ժամանակավոր ստեղծման խնդիրները չեն ջնջում նախկինում ստեղծված ֆայլերը: Ֆայլերը չեն հեռացվում, երբ հաշիվը վերադառնում է անվճար պլանին: Նոր ստեղծումը դեռևս հետևում է ակտիվ պլանին:
models: "OpenAI, Gemini, Google Cloud, Chirp3 HD, Neural2, Polyglot, WaveNet"
langs: "98 languages, 300+ voices (commercial)"
control: "Voice Vibes + Smart Pronunciation Aliases"
keys: "No API Keys Required"
Ձայնային թրթռումները (առևտրային) արագ արձագանքման ոճի են, այլ ոչ թե նոր կոնկատենատիվ բանկ։ Այլանունները որոշում են, թե ինչպես է հնչում թոքենը՝ առանց տեսանելի HTML-ը փոխելու։ Երկուսն էլ կառավարման շերտեր են՝ շարժիչի կողմից այդ ձայնի համար ընտրված ակուստիկ մոդելի վերևում։
Տեքստի խոսքի տեխնոլոգիայի վերաբերյալ հաճախակի տրվող հարցեր
Մոդելներ և խողովակաշարեր՝ ոչ թե պլագինների տեղադրում։
-
GSpeech-ը WaveNet-ն օգտագործո՞ւմ է ամեն լսման ժամանակ։
Ոչ։ WaveNet-ը Google ընտանիքներից մեկն է մի քանիսի շարքում։ Unified AI Voice Engine-ը նաև ուղղորդում է Neural2, Polyglot, Chirp3 HD, Gemini և OpenAI՝ կախված ձեր ընտրած ձայնից։ «Միանգամից ստեղծել, պահել և նվագարկել» գործառույթը նշանակում է, որ կրկնակի նվագարկումները օգտագործում են պահված ֆայլը, այլ ոչ թե նոր հետազոտական ոճի նմուշային ցիկլ։
-
Ինչո՞ւ է դեռևս հիշատակվում կոնկատենատիվ TTS-ը։
Սա պատմական ելակետն է՝ ձայնագրված միավորների միացում։ Նեյրոնային մոդելները ստեղծում են աուդիո՝ վանկերի սոսնձման փոխարեն։ Շաղկապային և WaveNet-ի միջև եղած տարբերությունը հասկանալը բացատրում է, թե ինչու են ժամանակակից առևտրային ձայները կարող փոխել ոճը առանց նոր ձայնագրման սեսիայի։
-
Կարո՞ղ եմ այս մոդելները գործարկել իմ սեփական սերվերի վրա։
GSpeech-ի կայքի արտադրանքը ամպային մշակում է, սերվերի ծանրաբեռնվածություն չկա: Դուք չեք հոսթինգում WaveNet, Gemini կամ OpenAI WordPress-ում: API բանալիներ անհրաժեշտ չեն. հաշիվ-ապրանքագրերը և բանալիները մնում են Cloud Console-ում:
-
2016 թվականի MOS-ը կիրառելի՞ է այսօրվա GSpeech-ի համար։
Այս էջում ներկայացված MOS գրաֆիկը Google-ի կողմից հրապարակված WaveNet գնահատականն է: GSpeech-ը չի պնդում, որ նույն թիվը ստացվում է յուրաքանչյուր ներկայիս ձայնի համար: Ներկայիս առևտրային որակը ստացվում է վերևում նշված շարժիչի համադրությունից, այլ ոչ թե 2016 թվականի MOS-ը որպես ապրանքի գնահատական վերատպելուց:
-
Gemini Pro vs Gemini Flash - ո՞րն է տարբերությունը:
Նույն Gemini TTS ընտանիքը և նույն հատուկ ձայնային հուշումների լեզուն (ոճ, առոգանություն, տեմպ, տոն, հույզեր, մատուցում): Flash-ն ավելի արագ է կատալոգների համար. Pro-ն ավելի բարձր ճշգրտության ուղի է ֆլագմանային էջերի համար: Ոչ մեկը չի պահանջում Gemini API բանալի GSpeech-ում. ձայնը դուք եք ընտրում Cloud Console-ում:
-
Chirp3 HD-ն նույնն է, ինչ WaveNet-ը։
Ոչ։ WaveNet-ը Google-ի 2016 թվականի հում-ալիքաձև մոդելների ընտանիքն է։ Chirp3 HD-ն ավելի ուշ շրջանի բարձր թույլտվության Cloud TTS սերունդ է՝ ռեալիզմի և ինտոնացիայի համար։ Neural2, Polyglot և WaveNet ձայները դեռևս գոյություն ունեն Google Cloud կատալոգում (230+ հարկ)։ GSpeech-ը Chirp3 HD-ն ներկայացնում է որպես կոնսոլային ձայն՝ առանց Google Cloud նախագծի։
Թղթից մինչև ձայն վահանակում
Կոնկատենատիվ բանկերը, պարամետրիկ ձայնակոդավորիչները և WaveNet-ի հում ալիքաձևի խաղադրույքը ծագումնաբանությունն են: Gemini TTS (Pro / Flash)-ը ավելացնում է արագ կառավարվող փոխանցում. Chirp3 HD-ն Google Cloud-ի ներկայիս HD նեյրոնային ընտանիքն է: GSpeech կայքում դուք լսում եք ներկայիս Unified AI Voice Engine-ը վիջեթի միջոցով՝ ամբողջական էջ, կոճակ, շրջանակ կամ Կարդալ ընդգծված տեքստը (RHT) - առաջին սերնդից հետո պահպանված ֆայլերով: «Պե՞տք է իմ URL-ը ունենա նվագարկիչ» հարցման համար օգտագործեք առավելությունների մասին հոդվածը: WP-admin սեղմումների համար օգտագործեք հրահանգները:
