Открытая модель обошла закрытую на задачах по программированию — и это мало что меняет
Очередная таблица лидеров переставила местами открытую и проприетарную модель. Разбираем, что за этим стоит и почему цифры обманчивы.
Новый отчёт поставил открытую модель на первую строку в таблице задач по программированию, обойдя проприетарную примерно на два процентных пункта. Новость облетела ленты за пару часов, но читать её стоит внимательнее.
Откуда взялись два процента
Разница такого размера почти всегда лежит внутри погрешности измерения. Тесты на код оцениваются автотестами, а автотесты — штука хрупкая: стоит поменять формулировку задачи или порядок примеров, и места меняются. Авторы отчёта честно оговаривают это в сноске на восьмой странице, до которой почти никто не доходит.
Что действительно изменилось
Важнее не место в таблице, а то, что вес модели стал таким, что её можно запустить на одной машине. Год назад подобное качество требовало серверной стойки и договора с облаком.
- Вес модели умещается в память обычной рабочей станции.
- Скорость вывода достаточна для интерактивной работы.
- Лицензия разрешает коммерческое использование.
Где подвох
Качество на публичных тестах и качество в реальной работе расходятся сильно. Публичные задачи размечены и хорошо сформулированы; реальные запросы приходят с опечатками, вперемешку с контекстом и без внятного описания цели. Здесь разрыв между моделями обычно больше, чем в таблице, — причём в обе стороны.
Что смотреть вместо таблиц
Смотрите на скорость, цену за миллион токенов и поведение на ваших собственных задачах. Возьмите сотню реальных запросов из своей работы, прогоните через обе модели и сравните глазами. Это займёт вечер и даст больше, чем любая таблица лидеров.