Обучению языковых моделей мешает некачественное распознавание текстов старыми OCR
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
Новые алгоритмы, исследования от ведущих лабораторий. Практические применения машинного обучения в бизнесе, науке и повседневной жизни.
Проект FineBooks протестировал 14 OCR-моделей на исторических книгах, выявив лучшие инструменты для подготовки чистых данных для обучения языковых моделей.
NVIDIA представила технологию NTP, позволяющую динамически менять степень тензорного параллелизма для предотвращения простоев при обучении больших языковых моделей.
Компания Meta* ввела строгие ограничения на использование инструментов Claude Code от Anthropic и Codex от OpenAI своими инженерами. Это сделано для предотвращения попадания результатов работы чужих алгоритмов в собственные обучающие выборки и защиты интеллектуальной собственности.
Google представила OpenRL, open-source решение для дообучения языковых моделей на Kubernetes, которое разделяет управление инфраструктурой и исследовательскую работу.
Исследователи представили метод обучения LLM рассуждениям с минимальной разметкой, используя специальный верификатор и энтропийную фильтрацию данных.
Стартап Mode Inc активно скупает потребительские приложения, чтобы предоставить пользователям возможность зарабатывать на своих данных, которые затем используются для обучения ИИ-моделей.
Новая модель Count Anything от исследователей Университета Цинхуа решает сложную задачу универсального подсчета объектов на изображениях разных типов с помощью текстовых подсказок.
Исследователи представили ReSum — метод обучения LLM самостоятельному сжатию своих мыслей для повышения точности и сокращения затрат на токены.
Исследователи из Sapient представили архитектуру HRM-Text, позволившую обучить базовую модель с 1 млрд параметров всего за 1500 долларов, бросив вызов доминированию тяжелых трансформеров.
Исследование показывает, что продвинутые языковые модели демонстрируют общие паттерны взаимодействия при предсказании токенов, что открывает путь к универсальному аудиту ИИ.