В «Яндексе» рассказали о дефиците текстов на различных языках для обучения LLM
Разработчикам нейросетей не хватает текстов на различных языках для их обучения. Об этом на форуме Data Fusion сообщил директор по развитию технологий искусственного интеллекта (ИИ) «Яндекса» Александр Крайнов, его слова приводят «Ведомости». В первую очередь речь идет о текстах на экзотических языках.
Существование такой проблемы подтверждает менеджер ИИ-продуктов Just AI Алексей Борщов. Он акцентирует внимание на наличии сложностей с диалектами, редкими языками и языками с ограниченным объемом текстовых данных.
В Innostage рассказывают, что на полезность текстов также влияют культурный уровень, разнообразие тематик общения и качество владения языком авторов.
Из-за нехватки количества обучающих данных может снижаться уровень и качество работы языковых моделей, они будут допускать гораздо больше ошибок. А это скажется на точности ответов нейросети и числе пользователей продукта.
Проблему с нехваткой текстов отчасти может решить перевод. Например, у «Яндекса» есть OCR-сервис (Optical Character Recognition) распознавания текста. Также можно оцифровывать тексты, которых ещё нет в интернете, и сотрудничать с языковыми сообществами и носителями редких языков.
***
📎 Помимо этого, в «Яндексе» говорят о росте запроса на наем специалистов в области разметки данных. В компании рассказали, что генеративные нейросети достигли достаточно высокого качества ответов, «поэтому, чтобы обучать их более сложным задачам, нужны в том числе профессионалы в конкретных отраслях: в математике, физике, биологии, юриспруденции». В целом по России с января по апрель этого года 77% вакансий в области разметки данных пришлось на позиции для соискателей уровня Senior.