Как работи

Това е частта, която повечето проекти „ИИ + история“ прескачат. Ето точно какво се случва между сканирана страница и твърдение на сайта — включително къде данните са разхвърляни и какво правим по въпроса.

01

Дигитализация

Работим със сканове на първоизточника в пълна резолюция — всяка страница, а не откъси, подбрани от някой друг. Текстът се възстановява с Tesseract OCR, том по том и страница по страница, така че всяко следващо твърдение може да бъде проследено обратно до конкретно сканирано изображение, а не до вторичен препис, написан от някого преди десетилетия.

Tesseract OCRсканове страница по страницацели томове, не откъси
02

Извличане

Суровият OCR текст преминава през структурирано извличане в пет свързани таблици: обекти (хора, божества, места, мотиви, ритуали — каквото първоизточникът реално съдържа), връзки между тях, доказателствата зад всяка връзка (пряк цитат и диапазон страници), конкуриращи се научни тълкувания и отворени въпроси, които самият текст не решава.

entities — име, тип, диапазон страници, увереност (0–1)
relationships — субект → предикат → обект, увереност
evidence — цитат, начална/крайна страница, извор
interpretations — твърдение, предложено от, увереност (ниска/умерена/висока)
open_questions — нерешено от самия текст
Postgres / Supabaseцитиране по страница — по замисълпубличен достъп за четене
03

Нормализиране

Извличането от свободен текст по природата си е разхвърляно — при стотици обработки един и същи тип фигура се изписва по десетина леко различни начина („Deity“, „Deity/Hero“, „Deity/Mythological being“...). Не изчистваме тихомълком това и не крием бъркотията. Графът разпределя типовете обекти в контролиран набор за разглеждане и оцветяване, като запазва оригиналния свободен етикет към всеки възел — така реалната бъркотия от извличането остава видима, вместо да бъде заличена от фалшива прецизност.

контролиран речник за разглежданеоригиналният етикет винаги се запазва
04

Кръстосана проверка

За всеки казус правим две независими проверки. Първо, графът се сверява със съществуващата публикувана научна литература — за Веда Словена, над 150 години от нея, на български, руски, сръбски, македонски, чешки, немски и английски — като всяко тълкуване е обозначено кой го предлага и колко силно е доказателството. Второ, където казусът позволява, провеждаме собствен количествен анализ, непосилен за обикновеното четене: за Веда Словена — стилометрично сравнение по метода Delta на Бъроуз върху 80-те най-чести словоформи в 25 текстови сегмента — проверка, каквато почти не е правена върху оспорвани фолклорни текстове, защото изисква код, а не само внимателно четене.

Висока увереност Умерена увереност Ниска увереност
Стилометрия по Delta на Бъроузмногоезичен литературен прегледувереност, не категоричност

Бележки

  • OCR и извличането въвеждат грешки. Точно затова всеки обект и връзка носи оценка за увереност — отнасяй се различно към 0.4, отколкото към 0.9.
  • Не всяка връзка се разрешава до два каталогизирани обекта. Някои обекти са описани в свободен текст, вместо свързани с друг възел — графът показва това честно като несвързан лист, вместо да налага фалшива връзка.
  • Извличането е един опит, не доказателство. Където учените спорят, графът проследява и двете страни, вместо да избира победител.