ИИ учат по битым сканам — и он глупеет втрое. Hugging Face и EleutherAI взялись это чинить


Одна из самых недооценённых причин, почему языковые модели путают факты, лежит не в архитектуре и не в размере обучающей выборки. Она лежит в том, как оцифровывали книги двадцать лет назад. Hugging Face и EleutherAI запустили проект FineBooks и первым делом измерили масштаб бедствия — он оказался неприличным.
Тридцать процентов вместо ста
Миллионы книг попали в обучающие корпуса не текстом, а картинками, через которые в нулевых прогнали распознавание. Тогдашний OCR работал как умел: путал буквы, склеивал слова, ронял строки, превращал таблицы в кашу. Этот текст никто не перечитывал — он просто лёг в датасет и уехал в обучение.
Проект Talkie поставил чистый эксперимент: взяли одни и те же книги и обучили одну и ту же модель — сначала на старом OCR-тексте, потом на человеческих транскрипциях.
Модель, обученная на OCR-тексте, училась с эффективностью 30% от той, что училась на человеческой расшифровке тех же самых книг.
То есть три четверти вычислений, электричества и денег уходят в пустоту — модель добросовестно заучивает чужие ошибки распознавания вместо содержания книги. Это не «немного шума в данных». Это значит, что за одни и те же деньги вы получаете втрое меньше знаний.
Можно ли просто перечитать всё заново
Очевидное решение — прогнать сканы через современные модели зрения. Неочевидный вопрос — справятся ли они. FineBooks собрали эталон: 2165 страниц исторических книг, расшифрованных экспертами вручную ещё в 2011–2012 годах в рамках проектов IMPACT и BHL-Europe. Качество эталона — примерно одна ошибка на две тысячи символов. Языки: английский, французский, немецкий и латынь.
На этом эталоне прогнали 14 открытых OCR-моделей. Главный сюрприз — маленькие модели регулярно обходили больших. Тройка лидеров: dots.mocr (3B) — 97,6% точности при $1,94 за тысячу страниц; OvisOCR2 (0,9B) — 96,9% при $0,46; PaddleOCR-VL-1.6 (1B) — 96,1% при $0,34.
Обратите внимание на последнюю строку: модель на миллиард параметров теряет полтора процента точности относительно лидера, но стоит в шесть раз дешевле. На объёмах в сотни тысяч книг это разница между «проект есть» и «проекта нет».
Почему это важно
Вывод исследователей аккуратный и честный: полученный текст достаточно хорош, чтобы учить на нём ИИ, но всё ещё слишком грязен для научной работы — филологу такая расшифровка не подойдёт. Зато для обучения моделей планка взята.
Дальше FineBooks собирается перераспознать около 200 тысяч изданий из Biodiversity Heritage Library — библиотеки, где лежит больше 300 тысяч оцифрованных трудов по естественной истории, — и выложить результат открытыми датасетами. Эталон уже опубликован под лицензией CC-BY, лидерборд и код проверки открыты.
Смысл истории шире одной библиотеки. Индустрия последние годы гналась за архитектурами и параметрами, а под ногами всё это время лежал бесплатный множитель качества: перечитать заново то, что уже есть. Не собрать новые данные, а починить старые.
Источник: The Decoder · Исследование: блог FineBooks на Hugging Face



















