Definice generativní AI
Generativní umělá inteligence (generativní AI nebo GenAI) označuje modely AI, které vytvářejí nový obsah, místo aby pouze analyzovaly existující data. Může jít o text, obrázky, zvuk, video, 3D objekty, kód nebo strukturovaná data.
Tyto modely se trénují na obrovských datových sadách. Naučí se statistické zákonitosti dat natolik dobře, že dokážou vytvářet nové příklady, které do nich přirozeně zapadají: nový odstavec, obrázek nebo melodii.
Generativní AI se dostala do povědomí široké veřejnosti po spuštění ChatGPT v listopadu 2022. Od té doby se generativní modely staly multimodálními, výrazně se zlepšily v uvažování a jejich používání výrazně zlevnilo.
Generativní AI vs. tradiční AI
| Tradiční (prediktivní) AI | Generativní AI | |
|---|---|---|
| Hlavní úkol | Třídit, předpovídat, rozpoznávat | Vytvářet nový obsah |
| Výstup | Štítek, skóre nebo číslo | Text, obrázky, zvuk, video, kód |
| Příklad | Je tento e-mail spam? | Napište odpověď na tento e-mail |
| Typické modely | Rozhodovací stromy, klasifikátory, regresní modely | Velké jazykové modely, difuzní modely |
| Interakce | Běží na pozadí | Konverzační, na základě promptů |
Jak funguje generativní AI
Text: předpovídání dalšího tokenu
Velký jazykový model přečte vaše zadání jako posloupnost tokenů, předpoví nejvhodnější další token, přidá ho a postup opakuje. Nastavení zvané teplota určuje, jak odvážně model vybírá. Po úvodním trénování na obrovském množství textů se modely dále ladí pomocí zpětné vazby od lidí a AI, aby byly užitečné a bezpečné.
Obrázky: od šumu k výslednému obrazu
Difuzní modely se učí odstraňovat z obrázků šum. Při generování začnou náhodným šumem a krok za krokem ho odstraňují. Řídí se přitom textovou reprezentací vašeho zadání, dokud nevznikne obrázek odpovídající popisu.
Zvuk a video
Modely pro řeč a hudbu vytvářejí zvuk jako posloupnost zvukových tokenů nebo spektrogramů. Modely pro video rozšiřují generování obrázků v čase a zachovávají návaznost objektů a pohybu mezi snímky.
Propojení se zdroji a nástroji
Generativní modely se často propojují s vyhledáváním, dokumenty nebo databázemi (generování s využitím vyhledaných informací), aby jejich výstupy vycházely z aktuálních a ověřitelných informací. Přečtěte si celý průvodce fungováním AI
Typy generativních AI modelů
Velké jazykové modely (LLM)
Transformerové modely pro text a kód. Tvoří základ chatovacích asistentů.
Modely pro uvažování
LLM trénované tak, aby před odpovědí na složité otázky uvažovaly krok za krokem.
Modely difuze
Generují obrázky a video postupným odstraňováním šumu.
Multimodální modely
Jeden model, který pracuje s textem, obrázky, zvukem a někdy i videem.
GAN a VAE
Starší generativní architektury, které se stále používají pro některé úlohy s obrázky a daty.
Modely pro řeč a hudbu
Převod textu na řeč, úprava hlasu a generování hudby.
Oblíbené nástroje generativní AI
- Chatovací asistenti: ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google), Microsoft Copilot, Meta AI a další.
- Rodiny modelů s otevřenými vahami: Llama, Mistral, Qwen, DeepSeek a další, které mohou firmy provozovat na vlastních serverech.
- Generování obrázků: nástroje založené na modelech od OpenAI, Google, Midjourney, Stability AI, Black Forest Labs a dalších.
- Generování videa: modely jako OpenAI Sora, Google Veo a Runway.
- Asistenti a agenti pro programování integrovaní do editorů kódu.
Pořadí modelů se mění každých pár měsíců, proto mnoho lidí dává přednost aplikacím, které nabízejí přístup k několika špičkovým modelům na jednom místě.
Co můžete dělat s generativní AI
- Pište a upravujte: e-maily, zprávy, eseje, příspěvky na sociální sítě a překlady.
- Učte se: získejte vysvětlení na své úrovni, kvízy a studijní plány.
- Přemýšlejte: hledejte nápady, zvažujte pro a proti a prověřujte své plány.
- Vytvářejte vizuály: ilustrace, produktové obrázky, náhledové obrázky a koncepty.
- Tvořte: pište kód, analyzujte data a automatizujte rutinní úkoly.
- Mluvte: hrajte scénáře rozhovorů, trénujte pracovní pohovory nebo vyjednávání s AI postavami.
Méně známým, ale užitečným způsobem využití je strukturovaná debata. Místo jedné vygenerované odpovědi několik AI postav předloží co nejsilnější argumenty pro různá stanoviska a AI soudce je porovná. Díky tomu lépe uvidíte, co při rozhodování získáte a co ztratíte.
Omezení a rizika
- Halucinace: věrohodně znějící, ale nepravdivá tvrzení, citace nebo čísla.
- Autorská práva a souhlas: dosud nevyjasněné právní otázky týkající se trénovacích dat a generovaných děl.
- Deepfaky a dezinformace: realistické falešné obrázky, zvuk a video. Nařízení EU o AI vyžaduje označování určitého obsahu vytvořeného pomocí AI.
- Předsudky a stereotypy převzaté z trénovacích dat.
- Soukromí: při zadávání pokynů si dávejte pozor na osobní a důvěrné údaje.
Jak psát lepší prompty
| Slabé zadání | Lepší zadání |
|---|---|
| Napiš něco o elektromobilech. | Napiš úvod blogového článku o 300 slovech pro lidi, kteří kupují auto poprvé. Přátelským tónem porovnej elektromobily a hybridní auta a na závěr uveď tři otázky, které by měli položit prodejci. |
| Obrázek psa. | Štěně zlatého retrívra sedící v podzimním listí, jemné ranní světlo, malá hloubka ostrosti, fotorealistický styl. |
| Mám dát výpověď? | Dejte mi nejsilnější argumenty pro a proti odchodu ze stabilního zaměstnání kvůli podnikání. Mám úspory na šest měsíců. |
Vzorec: kontext, cíl, formát, omezení a pokud možno příklad toho, jak má vypadat dobrý výsledek.