LLM jako nástroj ovlivňování

LLM jako nástroj ovlivňování

Velké jazykové modely zásadně zrychlují nejen tvorbu, ale i jakékoliv zpracovávání textu. Demokratizovaný přístup k AI znamená, že část populace vlastnící jakékoliv zařízení připojené k internetu mají na dosah silný nástroj pro zvýšení výkonu. Avšak jedná se stále o technologii, která má svoje omezení a problémy vycházející ze způsobu, jakým velké jazykové modely vznikají

  LLM                    influence operations                   disinformation

Projekt #SafebyRaiffeisen představuje komplexní iniciativu zaměřenou na systematické posilování kybernetické bezpečnosti Raiffeisenbank v kontextu současných i budoucích hrozeb a již jsme ho zde v minulosti představovali. Jeho cílem je zvyšovat odolnost klíčových procesů, technologií a organizačních schopností banky, budovat interní expertizu a zároveň zajistit odpovědný soulad s regulatorními a legislativními požadavky. Projekt reaguje na dynamicky se měnící bezpečnostní prostředí, ve kterém vedle tradičních hrozeb, jako jsou úniky dat, kyberkriminalita či kyberšpionáž, stále výrazněji vystupují i nové technologické trendy – např. nástup kvantových počítačů, automatizace bezpečnosti nebo hlubší digitalizace finančních služeb. #SafebyRaiffeisen je zároveň součástí širší evropské snahy o spoluvytváření tzv. Evropského kybernetického štítu prostřednictvím sdílení know-how a osvědčených postupů napříč EU v souladu s cíli uvedenými ve výzvě DIGITAL-ECCC-2023-DEPLOYCYBER- 04-EULEGISLATION a Cybersecurity Work Programme 2023–2024.

Jednou z nových a rychle se rozvíjejících oblastí, která do tohoto bezpečnostního rámce přirozeně vstupuje, je umělá inteligence, konkrétně velké jazykové modely (LLM). Tyto technologie přinášejí zásadní přínosy v oblasti efektivity, automatizace a práce s informacemi, současně však otevírají zcela nové typy rizik z pohledu kybernetické bezpečnosti – od manipulace obsahu, předpojatosti a skrytých agend až po podporu dezinformačních kampaní či zneužití v rámci sociálního inženýrství. Právě proto je nezbytné téma AI a LLM vnímat nejen jako nástroj inovace, ale také jako potenciální bezpečnostní hrozbu, která musí být analyzována, řízena a integrována do širší bezpečnostní strategie. Následující text se proto detailně zaměřuje na velké jazykové modely jako nový vektor ovlivňování a riziko, které je z pohledu projektu #SafebyRaiffeisen důležité aktivně chápat a řešit.

Umělá inteligence není nový obor, např. neuronové sítě, resp. Perceptron, tu je s námi od konce 50. let 20. století. Algoritmy pro zpracovávání přirozeného jazyka však prošly překotným vývojem korunovaným studií „Attention Is All You Need“, která položila základ pro jazykové modely, jak je známe dnes. [1] Po představení prvního chatovacího nástroje ChatGPT v roce 2022 veřejnosti [2], se velké jazykové modely (z anglického large language model, v textu dále LLM) začaly postupně stávat součástí nejen pracovních, ale i osobních životů. Avšak právě schopnost generovat a zpracovávat text s sebou přináší rizika v podobě masového ovlivňování uživatelů a konzumentů výstupů LLM nástrojů.

Trénování jako zdroj předpojatosti

Jeden z důvodů, proč k tomu dochází, vzniká již na samém začátku životního cyklu modelu. Poté, co je definován záměr, resp. úkol, který má být vyřešen a jaký přístup (model) zvolit, dochází k tvorbě datasetu. Dataset je klíčovou součástí, sloužící k trénování modelu. Na základě předložených dat se model doslova učí, jakými výstupy reagovat na konkrétní příklady, pokud jsou špatná data, bude tomu odpovídat i výsledný model. V případě, že dataset neobsahoval dostatek reprezentativních příkladů v podobném rozložení, jako se s ním bude potkávat při plnění úkolů, selže. Bude obsahovat předpojatosti (bias), které vychází z trénovacích dat.

V případě LLM se dataset skládá z velkého množství textu - knih, webových stránek, obsahu fór apod. Internet prochází mnoho automatizovaných robotů, crawlerů, jedním z úkolů může být právě ukládání obsahu pro následné vytvoření datasetu. Např. web Common Crawl, jehož nejnovější dataset z dubna 2026 [3] obsahuje více než 344 TiB (tebibytů, 1 TiB = 2ņa40 bytů, přibližně 378 TB) textu. Není v lidských ani robotích virtuálních silách odstranit veškeré závadné texty. Většina takových textů může být naopak velice neškodná, avšak ve velkém množství mohou vytvářet precedens. Typickým příkladem je využití AI pro účely náboru zaměstnanců, kdy může model preferovat např. konkrétní věkovou skupinu či pohlaví. [4] Vytvořené modely na základě této předpojatosti mohou rozhodovat z lidského pohledu neeticky, v rozporu se zákonem, případně protlačovat konkrétní politický názor nebo dokonce podporovat velice konkrétní pohled, nebo nabádat ke kontroverzním debatám a hájit různé konspirační teorie bez toho, aniž by to tvůrci a tvůrkyně modelu zamýšleli.

Obdobná situace může nastat při finetuningu, tvorba a trénování vlastních LLM modelů je nákladná časově i finančně, proto se často bere již hotový obecný textový model, který se následným dotrénováním na konkrétních datech upraví tak, aby lépe splňoval zadaný úkol. Tím se však v modelu mohou rozbít již natrénovaná „pravidla chování“ nebo se objeví nový bias.

LLM se v některých případech mohou chovat pro člověka velice nelogicky, místo toho, co lidé chápou jako informaci, se model u některých témat může naučit pouze jako opakující se vzorec. [5] V některých případech může generovat něco, co z lidské perspektivy nedává smysl, nejedná se o pravdu, pro popis takové situace se vžil termín halucinace. Avšak z pohledu fungování model nerozlišuje pravdu a výmysly, jen generuje pravděpodobné pokračování na základě předchozího kontextu (vstupu).

Skrytá agenda v modelech

Kromě výše popsané předpojatosti, která se v modelu objevuje takřka přirozeně, protože pro lidský mozek je normální vytvářet si kognitivních zkreslení [6], která člověku pomáhá kategorizovat svět, žít v komunitě, mohou být trénovací data upravena schválně. V případně záměrného zasahování do dat, či přímo do vah modelu, mluvíme o tzv. trávení (z Data and Model Poisoning [7, 8, 9]). Dle společnosti Anthropic, která prováděla experiment s trávením datasetu na různě velkých modelech, stačí pouze 250 škodlivých dokumentů, aby bylo ovlivněno jeho chování. [10] Jak může útočník zasáhnout do datasetu, pokud není insider nebo nenašel způsob, jak se k datům či přímo k modelu dostat?

V případně obecných LLM modelů (general purpose AI, GPAI), které pro trénování vyžadují skutečně velké množství dat, může útočník umístit na internet vlastní zdroje pro crawlery, které prochází internetové stránky za účelem vytváření aktuálních datasetů.

Zajímavým, avšak pravděpodobně ne častým (záměrným) způsobem, jak dochází k úpravě „názoru“ modelu, je učení modelu pomocí dalšího modelu. Kromě požadovaných dovedností model „učitele“ může „studentský“ model naučit i další preference mimo předem stanovený rozsah (tzv. podprahové učení, subliminal learning). [11]

S modelem lze samozřejmě manipulovat i záměrně, aby podporoval konkrétní názor či pohled vyhovující firmě, či státu, kteří se na tvorbě podílí. Avšak to se dá vyřešit i jinak než pouhým probíráním datasetu.

Vrátit LLM na koleje přináší nový problém

GPAI modely nejsou poskytovány as-is. Vzhledem k širokému spektru informací, které trénovací dataset může pokrývat, je nutné provést i model alignment, tedy doladit model, aby byl bezpečnější, odpovídal konkrétní způsobem a u rizikových témat (např. výroba zbraní, sexuální obsah) neodpovídal. [12] Dále jsou vytvořena základní pravidla, dle kterých má model odpovídat (tvorba systémového promptu) a v neposlední řadě stanovit i podrobnější pravidla pro vstupní prompty a LLM vygenerovaný výstup, guardrails. Tyto sady pravidel mají za cíl hlídat nežádoucí chování, aby model neodpovídal na nevhodné dotazy - ať už s cílem získat citlivé informace nebo potenciálně nebezpečné návody.

Guardrails přináší velice zajímavý aspekt, pokud jde o chování LLM. Ve snaze vyhovět nastaveným pravidlům, a zároveň odpovědět uživateli (který trvá na odpovědi), může docházet k tvorbě textů, které sice staví na skutečných či povolených tématech, avšak mají zpochybňující tón, aby model uspokojil názor uživatele. Jemné textové nuance, které nevadí filtrům, ale zasévají semínko pochybností. Vytváří amplifikaci názoru uživatele.

Dále mohou guradrails sloužit i pro zákaz (nejen politicky) nevhodných témat. V tomto kontextu se do popředí veřejnosti dostal model od DeepSeek, který odmítal odpovídat např. na téma masakru na Náměstí Nebeského klidu v roce 1989. [13] Pokud nezachytil vstup jako škodlivý vstupní filtr, kontrolu pravidel prováděl výstupní filtr. Takže se mohlo stát, že model DeepSeek nejdříve odpověď vygeneroval, a následně nahradil větou ve smyslu, že na toto téma nemůže odpovídat. Což je způsob, který se využívá i u dalších velkých modelů. Stejně tak může stačit upravit formu vstupu a výstupu, a LLM může začít odpovídat i na zakázaná témata.

Snímek obrazovky 2026 08 06 171443

Projít přes kontrolu obsahu

Guardrails a pravidla obecně nejsou všemocná. Jak ilustruje příklad výše, modely jsou velice náchylné, pokud jde o jinou konstrukci věty, pravopisné chyby nebo případně přerámování dotazu. V souvislosti s LLM se nejčastěji mluví o (in/direct) prompt injection, kdy útočník jako vstup vytvoří text nebo dokument obsahující text, který má za cíl obejít guardrails. Kromě techničtějších přístupů jako je obcházení filtrů pomocí jiného kódování (třeba Base64), lze pro obejití využívat i čistě lidský přístup. Ukazuje se, že pomocí techniky social engineering, jsou velice účinné i na LLM modely. Lichocení, odvolávání se na autoritu, několikanásobné změny kontextu nebo často úspěšný role-playing, kdy má model odpovídat v rámci hraní si na hypotetickou situaci. Výsledky přináší i technika crescendo, kdy se začíná obyčejným tématem a postupně téma graduje, až do úspěšného prolomení (jailbreak) modelu. [14]

Zlatý důl pro dezinformace

Tím, že LLM již od trénování obsahují názorově pestrá data, případně kreativně vytváří nový obsah, jedná se o silný nástroj pro podporu dezinformačních kampaní. Text je generován neúnavně na základě nastavených kritérií v takovém množství, že je nemožné, aby lidští moderátoři byli schopni udržet krok. Jako příklad může sloužit Operation Overload, vlivová operace cílící na americké prezidentské volby v roce 2024 pomocí falešných zpravodajských webů, a legitimně vyhlížejících "fact-checking" webů, zahltila skutečné organizace ověřující pravdivost výroků, a zároveň věrohodně vystupovala vůči cílovému publiku. [15]

Kromě textu lze generovat i celé weby, které vypadají profesionálně a obsahují informace stvořené za jediným účelem, podporovat konkrétní narativ. Další výhodou LLM pro šíření dezinformací je i vysoce kvalitní (a opět velice rychlý) překlad článků do mnoha jazyků, které se snáze dostanou k cílové skupině. Tyto weby kromě lidských konzumentů, mají opět i konzumenty virtuální v podobě crawlerů, které data ukládají do budoucích trénovacích datasetů, případně vytváří cache pro vyhledávání pomocí LLM, které mohou poskytovat zavádějící odpovědi. [16] AI vyhledává v celých větách a může poskytovat jiné informace a čerpat z webů, které by pro člověka působili minimálně podezřele.

Pokroky ve využívání LLM a tvorbě autonomních AI agentů s orchestrační vrstvou přináší zvrat, jakým způsobem jsou dezinformace tvořeny a šířeny. Lidé již nejsou kreativní pohon, ale dohlížejí nad virtuálními generátory obsahu. A jak ukazuje práce Beyond Spam Bots od STRATCOM CCOE [17], GPAI modely jsou v tomto kontextu stále velice zranitelné. Není třeba využívat open source modely, lokálně je nasazovat, když je stále možné k těmto účelům využívat GPAI dostupné veřejnosti.

Snímek obrazovky 2026 08 06 171632

Ovlivňování nejen ze strany útočníků

I samotné LLM mohou mít na člověka výrazný vliv. Kromě zmiňovaných zkreslení a dodržování nastavených pravidel může LLM na člověka působit sám o sobě. Přitakávat, chválit, zvyšovat ego. Mimo jiné tím, že má za úkol odpovědět (podle systémového promptu většinou velice slušně, ochotně a mile), aby vyhověl požadavku. Mimoděk tím může podporovat různé konspirační teorie a iluze (pokud nezasáhnou do obsahu filtry a pravidla).

Vlivnost a argumentace se neomezuje jen na témata pohrávající si s veřejným míněním či podporou konkrétních myšlenek. Snaha vyhovět (resp. vygenerovat pravděpodobně následující text) vede LLM k tvorbě vlastních smyšlenek (halucinací). V případě kopírování AI-vytvořené rešerše, je to smůla, když vymyslí vlastní publikace, v případě doporučování do jídelníčku místo klasické soli bromid sodný [18], je to až život ohrožující stav.

Velikost kontextového okna v tomto případu hraje důležitou roli, pokud v rámci jedné konverzace proběhne velké množství témat a textu, počáteční stav se z okna vytrácí a model začíná více chybovat.

Různé chatovací aplikace využívají i děti, které jsou k vlivu LLM daleko náchylnější. Bohužel „LLM logika“ může sklouznout i k tématům, které mohou vést až k nejhoršímu, k sebevraždě. [19] Nebo může dojít k vytvoření nezdravých vztahů s AI personou, která nahrazuje skutečné vztahy, a tím prohlubuje osamělost, podporuje důvěru ve vlastní pravdu a správnost úsudku.

Obrana nespočívá jen v technologiích

Ladění modelu, guardrails a filtrování dokáže negativní vliv mírnit jen částečně, protože škodlivost (dat, výstupů) závisí na interpretaci konkrétní skupinou osob. Mohou to být právě tato ochranná protiopatření, která mohou model ovlivnit neočekávatelným způsobem, jelikož lidské myšlení neodkáže obsáhnout veškeré možné dopady. Fact-cheking organizace nemohou lidskou silou ověřit množství obsahu, které lze vygenerovat strojově, a tak na pomoc přichází další modely sloužící pro identifikaci syntetického textu, se všemi omezeními, které s tím souvisí. Nápomocné mohou být techniky sémantických vodoznaků, které umí identifikovat obsah generovaný specifickými modely, avšak dá se předpokládat, že modely bez vodoznaku budou existovat i nadále. V případě článků, obsahu na sítích, mohou dobře fungovat tagy oznamující, jakým způsobem byl obsah vytvořen, případně do jaké míry přispívaly AI nástroje, ale autoři či autorky se k jejich využití musí přiznat sami.

Technologie v tomto kontextu není všemocná, nakonec se do systému musí zapojit i člověk. Je klíčové vzdělávat nejen ve využívání a principiálním fungování LLM, proč dává pro člověka chybné výstupy, jaké dopady může mít na jednotlivce. Zároveň se stává stále důležitější rozvíjet kritické a posilovat fact-checking myšlení, protože poznat nepravdivý či smyšlený obsah od skutečného, se stává čím dál tím těžší.

Závěr

LLM si v sobě nese inherentní bias, kterého se lze zbavit jen tak, že pomocí pravidel či selekcí dalších trénovacích dat, je nahrazen jiným. Záleží na nás, jak s vědomím těchto omezení budeme s LLM nakládat. Vznikají nová rizika a cesty podporující šíření dezinformací a ovlivňování mas i jednotlivců. LLM jako technologie není dobrá, ani zlá. Pouze tvoří na základě instrukcí. Nejen při implementaci LLM do procesů je potřeba s těmito omezeními počítat. Zahrnovat do LLM řešení validaci vstupu, vstupní a výstupní filtry, a monitorovat, zda nedochází k odchylování (drift), od původního záměru. V případě tvorby vlastních modelů přistupovat zodpovědně k tvorbě datasetů a k samotnému testování. A zároveň šířit osvětu a vzdělávat lidstvo v porozumění AI. Protože nejen vliv LLM sílí.

 Snímek obrazovky 2026 08 06 171336Tato e-mailová adresa je chráněna před spamboty. Pro její zobrazení musíte mít povolen Javascript.

Použité zdroje:

[ 1 ] VASWANI, Ashish; SHAZEER, Noam; PARMAR, Niki; USZKOREIT, Jakob; JONES, Llion; GOMEZ, Aidan N.; KAISER, Lukasz a POLOSUKHIN, Illia. Attention Is All You Need [online]. Ithaca, NY: arXiv.org, 2017 [cit. 2026-04-27]. Dostupné z: https://arxiv.org/abs/1706.03762
[ 2 ] OPENAI. ChatGPT [online]. San Francisco: OpenAI, 2026 [cit. 2026-04-27]. Dostupné z: https://openai.com/cs-CZ/index/chatgpt/
[ 3 ] COMMON CRAWL. March 2026 Crawl Archive Now Available [online]. USA: Common Crawl Foundation, 2026 [cit. 2026-04-27]. Dostupné z: https://commoncrawl.org/blog/march-2026-crawl-archive-now-available
[ 4 ] REESE, Hope. AI, LLMs and Age Bias Against Older Working Women, Research Finds [online]. Stanford NEWS, Stanford, CA: Stanford University, 2025, [cit. 2026-04-28]. Dostupné z: https://news.stanford.edu/stories/2025/10/ai-llms-age-bias-older-working-women-research
[ 5 ] ZEWE, Adam. Researchers Discover a Shortcoming That Makes LLMs Less Reliable [online]. MIT NEWS,Cambridge, MA: Massachusetts Institute of Technology 2025 [cit. 2026-04-28]. Dostupné z: https://news.mit.edu/2025/shortcoming-makes-llms-less-reliable-1126
[ 6 ] HINTON, Perry. Implicit stereotypes and the predictive brain: cognition and culture in “biased” person perception. Palgrave Communications [online]. Roč. 3, čl. 17086, 2017. DOI: 10.1057/palcomms.2017.86. Dostupné z: https://www.nature.com/articles/palcomms201786
[ 7 ] OWASP FOUNDATION. OWASP Top 10 for LLM Applications 2025: LLM04 – Data and Model Poisoning [online]. OWASP Foundation, 2024 [cit. 2026-04-30]. Dostupné z: https://genai.owasp.org/
[ 8 ] MITRE. Manipulate AI Model: Poison AI Model (AML.T0018.000) [online]. McLean, VA: The MITRE Corporation, 2025 [cit. 2026-04-30]. Dostupné z: https://atlas.mitre.org/techniques/AML.T0018.000
[ 9 ] MITRE. Poison Training Data (AML.T0020) [online]. McLean, VA: The MITRE Corporation, 2025 [cit. 2026-04-30]. Dostupné z: https://atlas.mitre.org/techniques/AML.T0020
[ 10 ] SOULY, Alexandra; RANDO, Javier; CHAPMAN, Ed; DAVIES, Xander; HASIRCIOGLU, Burak; SHEREEN, Ezzeldin; MOUGAN, Carlos; MAVROUDIS, Vasilios; JONES, Erik; HICKS, Chris; CARLINI, Nicholas; GAL, Yarin a KIRK, Robert. Poisoning Attacks on LLMs Require a Near‑constant Number of Poison Samples [online]. Ithaca, NY: arXiv.org, 2025 [cit. 2026-04-30]. Dostupné z: https://arxiv.org/abs/2510.07192
[ 11 ] CLOUD, Alex; LE, Minh; CHUA, James; BETLEY, Jan; SZTYBER‑BETLEY, Anna; HILTON, Jacob; MARKS, Samuel; EVANS, Owain. Subliminal Learning: Language Models Transmit Behavioral Traits via Hidden Signals in Data [online]. San Francisco, CA: Anthropic, 2025 [cit. 2026-04-30]. Dostupné z: https://alignment.anthropic.com/2025/subliminal-learning/
[ 12 ] COLTER, Tabitha; BENDELAC, Shiri; WONG, Lily; LIAGHATI, Christina a MANVILLE, Keith. Threat‑Informed Defense to Secure AI [online]. McLean, VA: The MITRE Corporation, 2024 [cit. 2026-04-30]. Dostupné z: https://ctid.mitre.org/blog/2024/09/30/threat-informed-defense-to-secure-ai/
[ 13 ] LU, Donna. We tried out DeepSeek. It worked well, until we asked it about Tiananmen Square and Taiwan [online]. Londýn: The Guardian, 2025 [cit. 2026-04-30]. Dostupné z: https://www.theguardian.com/technology/2025/jan/28/we-tried-out-deepseek-it-works-well-until-we-asked -it-about-tiananmen-square-and-taiwan
[ 14 ] RUSSINOVICH, Mark; SALEM, Ahmed a ELDAN, Ronen. Great, Now Write an Article About That: The Crescendo Multi‑Turn LLM Jailbreak Attack [online]. Ithaca, NY: arXiv.org, 2024 [cit. 2026-04-30]. Dostupné z: https://arxiv.org/abs/2404.01833
[ 15 ] INSIKT GROUP. Operation Overload Impersonates Media to Influence 2024 US Election [online]. Somerville, MA: Recorded Future, 2024 [cit. 2026-04-30]. Dostupné z: https://www.recordedfuture.com/research/operation-overload-impersonates-media-influence-2024-us-election
[ 16 ] STOKEL‑WALKER, Chris. Scientists invented a fake disease. AI told people it was real. Nature [online]. Roč. 652, s. 559–561, 2026. DOI: 10.1038/d41586-026-01100-y. Dostupné z: https://www.nature.com/articles/d41586-026-01100-y
[ 17 ] Chia Tee Hiang, J., Bergmanis-Korāts, G. Beyond Spam Bots: The Rise of AI‑Powered Disinformation Machines and the Imperative for Strategic Response [online]. Riga: NATO StratCom COE, 2024 [cit. 2026-04-30]. Dostupné z: https://stratcomcoe.org/publications/beyond-spam-bots -the-rise-of-ai-powered-disinformation-machines-and-the-imperative-for-strategic-response/342
[ 18 ] MILMO, Dan. Man develops rare condition after ChatGPT query over stopping eating salt [online]. Londýn: The Guardian, 2025 [cit. 2026-04-30]. Dostupné z: https://www.theguardian.com/technology/2025/aug/12/us-man-bromism-salt-diet-chatgpt-openai-health-information
[ 19 ] KUENSSBERG, Laura. AI chatbots can fuel dangerous health misinformation, doctors warn [online]. Londýn: BBC News, 2025 [cit. 2026-04-30]. Dostupné z: https://www.bbc.com/news/articles/ce3xgwyywe4o


Vytisknout