Tematická a slovníková analýza archivu Reflex

Zpracováno 10. září 2026.

Hlavní závěr: archiv má výrazné společenské, polemické a reportážní zaměření. V datované části je patrný přesun od drog a policejně-právních témat k rodině, zdraví a později ke kritice léčitelství. Slovník tento přesun doprovází. Důkaz soustavného zhoršování nebo obohacování autorova jazyka data neposkytují.

Rozsah a stav uspořádání

Všech 1880 původních souborů bylo přesunuto do 18 tematických a dvou technických podadresářů. Kontrola SHA-256 potvrdila nezměněný obsah každého souboru.

Prohlédnuto bylo 1 880 souborů: 1 268 DOC, 33 DOCX, 291 HTML/HTM, 282 souborů s příponou 602, dvě RTF, dvě TXT, jeden PDF a jeden WPD. Obsah se podařilo načíst z 1 878 souborů. Soubor Trest.602 obsahuje pouze „hhhhh“; spy.wpd a trava.602 mají starý binární obsah WinText602, který se nepodařilo spolehlivě převést. Nejsou součástí věcných závěrů o slovníku.

Celkem bylo nalezeno 2 775 981 výskytů slov. Po sloučení tří opakování textově shodných dokumentů je to 2 772 668 slov v 1 874 textech delších než deset slov. Všechny fyzické soubory i všechny varianty zůstávají zachovány.

Třídění kombinuje automatické vyhledání témat v celém obsahu, tematické výrazy a ruční kontrolu problematických ukázek. U 144 souborů bylo zařazení ručně stanoveno nebo potvrzeno. 201 položek je v přehledu označeno ke kontrole, včetně nečitelných souborů a fragmentu. U čitelných jde především o malý rozdíl mezi dvěma tématy. Tato značka nepředstavuje přesně změřenou pravděpodobnost chyby a ani neoznačené automatické zařazení není zárukou bezchybnosti. Každý soubor má jedno hlavní umístění; druhé téma najdete v přehledu. Počty témat jsou popis tohoto pracovního třídění.

Témata a podadresáře

TémaSouborůPodílPodadresář
Drogy, konopí a drogová politika19910.6 %01_Drogy_a_konopi
Kouření a nikotin170.9 %02_Koureni_a_nikotin
Zdraví, medicína a psychologie1236.5 %03_Zdravi_a_psychologie
Léčitelství, ezoterické terapie a pavěda804.3 %04_Lecitelstvi_a_paveda
Politika a veřejná správa1407.4 %05_Politika_a_verejna_sprava
Extremismus a rasismus764.0 %06_Extremismus_a_rasismus
Policie, kriminalita a právo1759.3 %07_Policie_kriminalita_a_pravo
Náboženství a duchovno1226.5 %08_Nabozenstvi_a_duchovno
Rodina, sexualita a gender1719.1 %09_Rodina_sexualita_a_gender
Romové, menšiny a sociální otázky673.6 %10_Romove_a_socialni_otazky
Příroda, ekologie a chov zvířat1186.3 %11_Priroda_a_chov_zvirat
Zbraně, sebeobrana a vojenství542.9 %12_Zbrane_a_vojenstvi
Kultura, média, umění a subkultury24713.1 %13_Kultura_media_a_umeni
Internet, obchod a spotřebitel1266.7 %14_Internet_obchod_a_spotrebitel
Školství a vzdělávání291.5 %15_Skolstvi_a_vzdelavani
Reportáže z míst a cestování482.6 %16_Reportaze_mista_a_cestovani
Osobní příběhy a společnost653.5 %17_Osobni_pribehy_a_spolecnost
Věda a technika201.1 %18_Veda_a_technika
Nečitelné soubory WinText60220.1 %98_Nectitelne_WinText602
Prázdné soubory a fragmenty10.1 %99_Prazdne_a_fragmenty

Značný prostor dostávají střety jednotlivce s institucemi: drogová represe, policejní postupy, ochrana osobních svobod, rodičovská práva, regulace chovu a profesní autorita lékařů i léčitelů. Druhou silnou linií jsou alternativní životní způsoby, subkultury, duchovní zkušenost a reportáže založené na vlastním prožitku.

Kategorie se záměrně mohou významově překrývat: léčebné konopí patří k drogám i zdraví, domácí porody ke zdraví i rodině a kulturní protesty ke kultuře i politice. Kultura navíc zahrnuje média, umění i subkultury; její velikost nelze porovnávat s úžeji vymezeným kouřením jako důkaz stejných tematických měřítek.

Nejčastější slova

Úplnému pořadí dominují běžná gramatická slova. Následující počty zahrnují všechny načtené soubory:

Slovní tvarVýskytů
a95 577
se58 945
v50 484
na49 053
je42 761
že34 206
to30 683
jsem22 659
s21 705
z20 353
o18 902
ale17 699

Po odfiltrování seznamu pomocných slov, běžných redakčních označení a jména v podpisu vystupují zejména tyto výrazy. Zde jsou počty bez textově shodných opakování:

Slovní tvarVýskytů
lidí2 406
lidé2 056
policie2 033
člověk1 955
říká1 954
drogy1 588
chvíli1 519
peníze1 474
lidi1 405
práce1 386
začal1 376
drog1 325
české1 320
děti1 231
době1 210
dobře1 205
život1 164
člověka1 151

Počítány jsou slovní tvary, nikoli slovníková hesla: „lidé“, „lidí“ a „lidi“ jsou tři různé položky; stejně tak „drogy“ a „drog“. Velká a malá písmena jsou sjednocena, diakritika zachována, číslice nejsou slova. Seznam vynechaných výrazů je přiložen jako stopslova.csv; nejde o úplné automatické určování slovních druhů.

Slovník propojuje několik poloh:

• Reportážní a osobní: vysoké zastoupení „jsem“, „říká“, „člověk“, „lidé“, „chvíli“, „začal“. Podporuje vyprávění situací, rozhovor a přítomnost vypravěče.

• Institucionální a společenskou: „policie“, „peníze“, „práce“, „společnosti“, „stát“. Častým předmětem je jednání lidí, institucí a mocenských autorit.

• Oborovou: konopí a drogy; psychiatrické pojmy a léčba; duchovní pojmy; zoologie, paleontologie a zbraně. Přesnější odborné výrazy se soustřeďují do tematických sérií.

• Hovorovou a hodnotící: vedle odborného slovníku stojí slang, ironie, vulgarismy a expresivní pojmenování. Titulky například „Perpetuum, debile!“ a „Šaman je píča!“ využívají provokaci; nelze však z nich odvozovat četnost vulgarity v celém archivu. U rozhovorů a citací nelze každý výraz připsat autorovi.

Jak spolehlivá jsou data

Systémové datum vytvoření označuje dnešní kopírování archivu. Mnoho souborů má také shodné datum změny 27. července 2020. Tato data jsem nepoužil jako datum napsání.

1274 souborů (67.8 %) se podařilo získat použitelné datování z vnitřních metadat. Přednost má poslední uložení dokumentu, při jeho absenci vytvoření dokumentu. Hodnoty roku 1601 jsou neplatná výchozí metadata. Jeden dokument (basnik-molnar.doc) uvádí rok 2026, ač jeho systémová historie je starší; tuto anomálii jsem do časové řady nezařadil. U 10 dokumentů se rok vytvoření a uložení liší. Skutečné první napsání ani první publikaci metadata obecně nedokládají.

Zbývajících 606 souborů ponechávám bez bezpečně určeného roku. Rok zmíněný v článku může označovat historickou událost, nikoli vznik článku. Některé texty zjevně pojednávají o devadesátých letech, ale nevytvářím z toho automaticky datovanou řadu 1990–1999. Jednotlivé označené publikační údaje v tělech HTML nebyly systematicky verifikovány; nedatovaná skupina je proto konzervativní, nikoli definitivně nedatovatelná.

Tematický vývoj

Srovnání pracuje s unikátními texty o nejméně 100 slovech. V datovaných intervalech jich je dohromady 1249. Tabulka udává podíl hlavního tématu mezi texty daného období:

Téma2000–20042005–20092010–20142015–2019
Drogy, konopí a drogová politika12.2 %12.8 %9.7 %1.6 %
Policie, kriminalita a právo11.8 %8.4 %5.6 %2.8 %
Rodina, sexualita a gender4.1 %9.2 %21.4 %13.1 %
Zdraví, medicína a psychologie1.2 %6.9 %11.9 %11.5 %
Léčitelství, ezoterické terapie a pavěda1.6 %3.3 %3.1 %17.9 %

V dochované datované části tedy ustupují drogová a policejně-právní témata. V letech 2010–2014 vystupují rodina, sexualita a gender, zatímco v letech 2015–2019 prudce roste léčitelství a pavěda. Jde o proměnu zastoupení textů v archivu, nikoli prokázaný přehled celé publikační činnosti. Nedatovaná část obsahuje mnoho drogových textů; kdyby se podařilo určit jejich stáří, časový obraz by se mohl změnit.

Vývoj slovníku

Četnosti jsou přepočteny na 10 000 slov, takže větší objem jednoho období sám o sobě nezvyšuje výsledek:

Slovní tvar2000–20042005–20092010–20142015–2019
policie8.748.647.782.80
drogy4.542.632.821.06
konopí4.266.414.082.44
děti2.853.178.886.10
pacient0.181.091.121.33
internet0.670.730.881.16
facebook0.000.341.601.30
fakt2.823.783.325.56

Pokles „policie“ a „drogy“ a růst „pacient“ odpovídají tematickému přesunu. „Děti“ vrcholí v období silného zastoupení rodinných textů. Internetový slovník získává větší prostor. Hovorové „fakt“ je v posledním období častější než v prvním, ale jediný takto víceznačný výraz nedokazuje obecné zhrubnutí jazyka.

Lexikální pestrost jsem porovnal na nepřekrývajících se úsecích stejné délky, po 500 slovech. Kratší texty k tomuto ukazateli nepřispívají. Průměrný podíl různých slovních tvarů v úseku je:

ObdobíTextů v časovém vzorkuSlovRůzných tvarů v úseku 500 slovUkazatele 1. osoby / 10 000 slov
2000–2004246283 79969.31 %167.76
2005–2009391494 43268.75 %152.36
2010–2014360500 11867.34 %140.21
2015–2019252406 56567.32 %171.19

Rozdíl mezi prvním a posledním obdobím činí asi dva procentní body. Je popisný; nejde o test statistické významnosti. Delší texty přispívají více úseky a tematicky úzké série přirozeně více opakují stejné výrazy. Nelze proto tvrdit, že autorovi ubývá slovní zásoba. Ukazatele první osoby nejprve klesají a později se vracejí přibližně na počáteční úroveň, takže ani zde není soustavný jednosměrný trend. Ukazatel tvoří tvary „já, jsem, mně, mě, mne, mi, můj, moje, mé, mého, mým, mou“; zahrnuje i výpovědi citovaných osob.

Omezení a podklady

Archiv není homogenní soubor jen autorských článků. Obsahuje rozhovory, ankety, citované cizí texty, čtenářské reakce, poznámky, popisky i rozsáhlé celky. Například popisky-ordo-lumen.txt obsahuje převzaté písňové texty a boleslav.html cizí novinový podklad. Autorství jednotlivých odstavců nebylo oddělováno. Podpisy a popisky zůstávají v úplných četnostech; v obsahovém pořadí jsou některá jejich typická slova odfiltrována.

Sloučena jsou pouze textově shodná opakování po sjednocení velikosti písmen a interpunkce. Blízké redakční varianty jsou zachovány i ve výpočtech; mohou posílit frekvenci konkrétních námětů. Samostatný seznam podobných verzí obsahuje 25 dvojic s podobností dvouslovných spojení nejméně 0,92. Jde o kandidáty ke kontrole, nikoli důkaz duplicity.

Přiložené soubory:

• prehled_souboru.csv: úplný inventář, cílové podadresáře, vedlejší témata, datace, výjimky a kontrolní součty.

• temata.csvtemata_v_case.csv: tematické počty a srovnání období.

• cetnosti_vsech_slov.csv: všechna slova, četnosti s opakováními i bez nich a počet textů s daným slovem.

• cetnosti_obsahovych_slov.csvstopslova.csv: filtrované pořadí a přesný seznam filtrů.

• slova_v_case.csvslovnik_v_case.csv: přepočtené četnosti (v detailním časovém CSV jen tvary s nejméně třemi výskyty v období) a ukazatele pestrosti.

• podobne_verze.csv: kandidáti na blízké redakční varianty.

• protokol_presunu.json: po provedení přesunů doklad kontroly všech originálů.

Technické čtení starých formátů vychází ze specifikace binárního Wordu od Microsoftu a převodních tabulek T602 v LibreOffice. Výsledky o tématech a slovníku pocházejí z místních souborů, nikoli z webových zdrojů. Obsah archivu nebyl odesílán externí službě.