site.btaПроектът за езикови модели осигурява експертни данни на български език за AI системи, каза проф. Светла Коева

Проектът за езикови модели осигурява експертни данни на български език за AI системи, каза проф. Светла Коева
Проектът за езикови модели осигурява експертни данни на български език за AI системи, каза проф. Светла Коева
Институтът за български език (ИБЕ) представя резултатите от международния научен проект „Инфраструктура за фина настройка на предварително обучени големи езикови модели“. Снимка: Иван Долев/БТА (ХТ)

Данните от международния научен проект „Инфраструктура за фина настройка на предварително обучени големи езикови модели“ запълват една празнина, като отговарят на необходимостта от специализирани данни на български език, които не са резултат от автоматичен превод, а са създадени от експерти. Това каза директорът на Института за български език „Проф. Любомир Андрейчин" към Българската академия на науките (ИБЕ - БАН) проф. Светла Коева по време на представяне на резултати от проекта. 

Разработеният набор от данни включва над 100 милиона документа и над 10 милиарда думи и е реализиран от екип от 13 изследователи в рамките на 18 месеца с финансиране по Плана за възстановяване и устойчивост на Република България. „Предлагаме голям обем данни на български език, които са специално прецизирани, почистени и класифицирани, така че всеки, който се занимава с допълнително обучение на големи езикови модели или с изкуствен интелект, да може да ги използва“, каза проф. Коева.

По думите ѝ проектът е осигурил ресурси, с които институтът не е разполагал досега, включително изчислителна мощност и капацитет за съхранение на големи масиви от данни. Важното е да има колкото може повече възможности за изследователски центрове в България, които да работят в тази област, добави тя.

Институтът е разработил и четири ресурса за оценка на големи езикови модели за български език. Проф. Коева добави, че институтът работи за създаване на модел, който да разпознава най-често срещаните правописни и пунктуационни грешки в българския език.

В рамките на представянето бяха изнесени три презентации, посветени на резултатите от проекта. Д-р Ивелина Стоянова представи управлението на метаданните и процесите по осигуряване качеството на данните в големия езиков набор IfGPT. Тя отбеляза, че е установено системно разминаване между начина, по който хората и езиковите модели оценяват пристрастията в текстовете.

Д-р Йордан Кралев представи инфраструктура за създаване на чатбот с големи езикови модели, която позволява на компании да работят със собствени вътрешни документи в затворена среда.

Д-р Валентина Стефанова представи набори от данни на български език, разработени от експерти специално за оценка на големи езикови модели.

/АУ/

„Час ЛИК“ на БТА е мястото за срещи отблизо с лицата на българската култура, наука, образование и религия. Подкастът може да бъде проследен в интернет страницата и в YouTube канала на БТА.

Списание ЛИК

В допълнение

Избиране на снимки

Моля потвърдете избраните снимки. Това действие не е свързано с плащане. Ако продължите, избраните снимки ще бъдат извадени от баланса на вашите активни абонаментни пакети.

Изтегляне на снимки

Моля потвърдете изтеглянето на избраните снимката/ите

Потвърждение

Моля потвърдете купуването на избраната новина

Към 05:49 на 13.08.2026 Новините от днес

Тази интернет страница използва бисквитки (cookies). Като приемете бисквитките, можете да се възползвате от оптималното поведение на интернет страницата.

Приемане Повече информация