Това е частта, която повечето проекти „ИИ + история“ прескачат. Ето точно какво се случва между сканирана страница и твърдение на сайта — включително къде данните са разхвърляни и какво правим по въпроса.
Работим със сканове на първоизточника в пълна резолюция — всяка страница, а не откъси, подбрани от някой друг. Текстът се възстановява с Tesseract OCR, том по том и страница по страница, така че всяко следващо твърдение може да бъде проследено обратно до конкретно сканирано изображение, а не до вторичен препис, написан от някого преди десетилетия.
Суровият OCR текст преминава през структурирано извличане в пет свързани таблици: обекти (хора, божества, места, мотиви, ритуали — каквото първоизточникът реално съдържа), връзки между тях, доказателствата зад всяка връзка (пряк цитат и диапазон страници), конкуриращи се научни тълкувания и отворени въпроси, които самият текст не решава.
Извличането от свободен текст по природата си е разхвърляно — при стотици обработки един и същи тип фигура се изписва по десетина леко различни начина („Deity“, „Deity/Hero“, „Deity/Mythological being“...). Не изчистваме тихомълком това и не крием бъркотията. Графът разпределя типовете обекти в контролиран набор за разглеждане и оцветяване, като запазва оригиналния свободен етикет към всеки възел — така реалната бъркотия от извличането остава видима, вместо да бъде заличена от фалшива прецизност.
За всеки казус правим две независими проверки. Първо, графът се сверява със съществуващата публикувана научна литература — за Веда Словена, над 150 години от нея, на български, руски, сръбски, македонски, чешки, немски и английски — като всяко тълкуване е обозначено кой го предлага и колко силно е доказателството. Второ, където казусът позволява, провеждаме собствен количествен анализ, непосилен за обикновеното четене: за Веда Словена — стилометрично сравнение по метода Delta на Бъроуз върху 80-те най-чести словоформи в 25 текстови сегмента — проверка, каквато почти не е правена върху оспорвани фолклорни текстове, защото изисква код, а не само внимателно четене.