Сравнение сильнейших нейросетей, свежая GPT 5.6 Sol от OpenAI против Claude Fable 5 от Anthropic. Задача одна на двоих по единственному промпту собрать локальное десктоп-приложение для диктовки, которое работает бесплатно. Для этого берём открытые русские модели распознавания речи от Сбера и Т-Банка. В финале живой тест готовых приложений, реальная стоимость каждого решения в долларах и вывод, почему разработка облачных сервисов постепенно умирает.
Все материалы из выпуска будут выложены в мой телеграм канал 👉 https://t.me/nikolay_khl
Мы обсуждаем:
– Какая модель лучше GPT 5.6 Sol или Claude Fable 5
– Как создать приложение-диктофон за один промпт
– Sol, Luna и Terra: зачем OpenAI ушла от цифр в названиях
– Какую подписку выбрать для работы с LLM
– Российские модели распознавания речи от Сбера и Т-Банка
– Как ставить задачу нейросети, если ты не программист
– Сколько стоит создать своё приложение в долларах
– Российские сервисы для распознавания голоса
– Сколько стоит создать свое приложение в долларах
– Живой тест трёх созданных приложений-диктофонов
– Почему капитализации облачных сервисов рухнули на 70%
00:00 — Вступление: батл GPT-5.6 против Claude Fable 5
01:40 — Что выпустила OpenAI: версии Луна, Терра и Сол
03:00 — Условия эксперимента: одна задача, два агента, максимальные настройки
04:28 — Цена вопроса: подписка за $20 против тарифа за $200
06:07 — Почему распознавать речь будет локальная модель Сбера
08:37 — ПРОМПТ: задача от полного дилетанта
10:27 — Опасный режим: агенты работают без разрешений
15:10 — РЕЗУЛЬТАТ: 57 минут и $46 против $165 и двух десятков итераций
18:50 — Живой тест трёх приложений-диктофонов
22:23 — Вердикт первого раунда и удар по облачным сервисам
24:16 — Финал: анонс второго раунда — сайт и 3D-игра
Оглавление (11 сегментов)
Вступление: батл GPT-5.6 против Claude Fable 5
Добрый день. Меня зовут Николай Хлебинский. Вы находитесь на канале Action Plan. Сегодня обсуждаем искусственный интеллект. Видео, в котором я с помощью искусственного интеллекта с нуля без абсолютно каких-либо навыков программирования создавал очень крутые сайты. В комментариях много людей написали, чтобы я показал, как я сделал приложение, с помощью которого я с искусственным интеллектом общаюсь. Я не пишу ему текстом с клавиатуры. Я надиктовываю голосом искусственному интеллекту свои мысли, и это очень удобно. В некоторых приложениях возможность использовать распознавание голоса сразу есть. в chatча в браузере или вот, например, десктопное приложение для клода на моём компьютере, с помощью которого я могу вот здесь нажать на микрофончик, начать что-то рассказывать, и он начнёт этот текст распознавать прямо на лету. Ну вот, видите, вместо слова нажать, здесь появилось слово уничтожить. Это работает не всегда очень хорошо. А бывают случаи, когда распознавания такого нет вообще. Но вот, например, часто пользуюсь Visual Studio Code. Сейчас расскажу попозже, что это такое. Здесь возможности диктовать по умолчанию нет. Поэтому я сделал простенькое приложение, в котором я могу зажать вот так кнопку. Появляется на экране всплывашка такая запись. Я начинаю диктовать свой текст. И как только я кнопку эту отпускаю, через некоторое время у меня появится текст, который я надиктовал. И, как видите, этот текст распознаётся значительно лучше, чем, например, вот только что антропик распознал. И это очень удобно. Я могу свои мысли надиктовывать в блокнотик, в текстовые заметочки, в, когда занимаюсь какой-то разработкой приложений или сайтов, когда общаюсь с искусственным интеллектом и так далее. В этом видео я вам покажу, как такое приложение сделать. Чтобы рассказ был интереснее, я хочу устроить баттл между
Что выпустила OpenAI: версии Луна, Терра и Сол
самыми крутыми нейронками, которые есть на сегодняшний день. Вот только что буквально вышла Open AI GPT 5. 6. Это новая версия Chat GPT. Они уходят от цифровых наименований, начинают называть их также, как основной конкурент словами. У Чап 5. 6 есть три версии, которые называются со Луна и Terra. Сол, соответственно, - это Солнце, Луна - это Луна и Терра - это Земля. Эти модели вышли только что, если зайти вот на такой вот сайт, который называется Agents Last Exam. Кстати говоря, все ссылочки, которые здесь упоминаются, все инструкции, все промты, всё на свете, я выложу у себя в Telegram-канале. Как только это видео наберёт 1. 000 комментариев или 1. 000 лайков, в зависимости от того, что случится раньше, пожалуйста, нажмите на кнопочку лайк. Мне это очень важно, для меня это очень полезно. Заранее вам спасибо. Так вот, на сайте Agency Last Exam, вот на этом вот сайте можно переключиться на бенчмаркиet. И здесь видно, что GPT 5. 6 S довольно серьёзно обходит по разным тестам. Эк Clot Opus 4. 8. Их ещё не сравнили с самой последней моделью антроop Clot Fable 5. Эти тесты обновляются, ну вот, буквально каждый день. А мы сегодня с вами проведём лай-тест. Поэтому вот это самое
Условия эксперимента: одна задача, два агента, максимальные настройки
приложение по распознаванию голоса я запущу одновременно чтобы создалось и в Open Ai GPT 5. 6, и в Clде Fable 5, а вы самостоятельно решите, что из них лучше. Ну я тоже своё мнение в конце расскажу. Значит, что мы для этого будем использовать? Первое, использовать вот такое вот приложение, которое называется Visual Studio Code. VS CД. Заходите на сайт cod. visualstudio. com. Его можно скачать для своей операционной системы. Это бесплатное IDE, так называемое. Что такое IDE или IDE? Это integrated developer Environment, то есть программа для разработки. Я не программист, я её использую. Выглядит эта программа вот так. Это редактор кода, в котором мы, собственно, сейчас и будем работать. Когда мы поставили VS-код, нам понадобится установить сюда два плагина, чтобы подключить искусственный интеллект к разработке. Для этого вот здесь вот в левом меню мы идём в раздел экстеншены. Ищем здесь, значит, первое клод. Находим с синей галочкой extension от компании Antropic, чтобы поставить себе именно то, что нужно. У меня это уже установлено. Жмём Install. Сам по себе extension бесплатный. Второе, что нам понадобится для баттла - это кодекс. Находим кодекс от компании Open синей галочкой, потому что много всего будет называться кодекс. Нам нужно именно это. Жмём Install и устанавливаем этот
Цена вопроса: подписка за $20 против тарифа за $200
extension. Всё, у нас Chat GPT последней версии и последней версии сюда теперь подключены. Для того, чтобы пользоваться клод-кодом в ВС-коде и сделать то, что мы сегодня собираемся сделать, вам нужна подписка клодкода платная. Нам понадобится вот эта вот функция, которая умеет писать код и которую мы только что добавили в VS-код. Она работает только начиная с версии Pro, который строит 17 баксов. И, скорее всего, на этом тарифе токены сгорят очень быстро. Я попрошу модельку нам рассказать, сколько токенов она подожгёт на задание, которое мы сегодня будем делать. Но имейте в виду, что мне хватает едва-едва тарифа за 200 долларов. На этой страничке даже нет. 200 долларов стоит тариф, который 20x токенов, которые вот здесь вот находятся. Что касается Open AI, э, кодекс модель и 5. 6 чат доступны с тарифа, который стоит 20 баксов. И токенов там много. Это значит, что кодекс сильно дешевле в купе с тем, что он на тестах показывает очень хорошие результаты относительно антропика. Мы все очень радуемся, что Open AI антроopл прикурить и ждём шага антропика, когда он сделает свою модель круче, дешевле и так далее. Чтобы сделать приложение, которое будет распознавать текст, нам необходимо две составляющие. Первое - это, собственно, десктопное приложение на компьютер, которое будет работать так, как я примерно сейчас опишу. И второе -
Почему распознавать речь будет локальная модель Сбера
это часть, которая будет распознавать текст. А я для того, чтобы сегодняшний эксперимент провести, решил выбрать абсолютно бесплатную версию вот этого распознавания, который каждый может у себя на более-менее нормальной машине развернуть. Значит, у меня на ноутбуке 16 Гб оперативки, процессор Apple M2. Три или 4 года этому ноутбуку. Вот я выбрал модели, которые должны точно вытянуться и сработать хорошо на моём ноутбуке. Мы будем сегодня использовать Gig AMV3. Это открытая модель, бесплатная, с открытым исходным кодом, которую можно скачать и использовать локально, без какой-либо оплаты, которую сделал Сбер. Почему я остановился на именно этом выборе? Потому что среди open source моделей, которые можно скачать бесплатно и использовать, модель от Сбера показывает лучше всего результаты в открытых тестах, которые я нашёл по распознаванию речи на русском языке. Поэтому я буду использовать её. В качестве альтернативы можно использовать модель, которая называется T1. Это модель тоже бесплатная, с открытым исходным кодом, которую опубликовал Тбанк. Вот так вот наши бигтехи врываются в мир open source искусственного интеллекта. Модель T1 по тестам из тех, что я нашёл, поправьте меня в комментариях, если я не прав, показывает результаты по распознаванию чуть хуже, но она гораздо быстрее. В ней меньше параметров, и она используется специфично для распознавания телефонных разговоров, где нужно очень быстрая скорость реакции модели и очень быстрый ответ. У меня к скорости претензий таких нет под мои домашние задачи, поэтому я буду использовать модель, которая работает по тестам точнее. Посмотрим, что из этого выйдет. Переходим в V в S-код. Для того, чтобы нам начать работу, нам нужно создать папку для проекта. Я папку уже создал. Значит, вот у меня папочка называется Whisper Soul Fable. Кстати, почему она называется Whisper? Потому что вдохновлён я, естественно, вот этим вот проектом. Wisperflow. AI это компания, которая выпустила первый популярный массовый во всём мире софт по распознаванию текста. Я его себе поставил. Он стоил, когда я себе поставил, 12 или 15 долларов в месяц. И я подумал: "Слушайте, а что я буду платить подписку 12 или 15 долларов в месяц, когда я могу попробовать сам навайп-кодеть себе за 2 доллара вот такое приложение? И посмотрим, что из этого выйдет. Собственно, из этого и
ПРОМПТ: задача от полного дилетанта
вышло приложение, которым я пользуюсь уже давно. А после просмотра этого видео вы сможете самостоятельно себе такое приложение тоже сделать и узнать, насколько же это удобно. Ну и вообще сделать, конечно, любое приложение такого характера. Ну и давайте, э, дадим первое задание солу. Как будет выглядеть мой промт? Мой промт будет выглядеть максимально дилетантский. Допустим, я не понимаю, как правильно писать промпты. программировать. Я вообще ничего не понимаю. Привет. Я хочу сделать для себя аналог WHP Flow. десктопное приложение лёгенькое, которое будет распознавать мою речь и переводить его в текст. Так, чтобы, значит, я вот нажал на клавиатуре кнопочку, которую я в какой-то очень простенькой менюшке сделал. Всплыло окошко, которое показывает, что пошла запись. В идеале будет показываться, идёт звук или нет, чем-то вроде такого мини эквалайзера или как это правильно называется. И дальше на Литу этот текст будет распознаваться. локально с помощью моделей от Сбера, ссылку на которую я тебе сейчас приложу. Сейчас я пользуюсь приложением своим. Надеюсь, что к концу этого видео буду использовать уже приложение новое. И вот эту вот ссылочку сюда кладу. Я поставлю на ультра. Это означает, что модель будет тратить максимальное количество усилий на продумывание результата. Что ещё я сделаю? Ну, для целей записи видео. Я так не буду делать на своих боевых проектах, но для целей записи видео я поставлю вот здесь вот фаast, чтобы за большее количество токенов система быстрее работала в полтора раза. И ещё я включу вот этот вот режим, который называется Full Access. Надо
Опасный режим: агенты работают без разрешений
делать это с большой осторожностью. Включение этого режима позволяет нейронной сети, позволяет языковой модели, кодексу действовать полностью на своё усмотрение. Если этот режим включен, она не будет спрашивать разрешений никаких на что бы то ни было во время своей работы. Надо понимать, что это достаточно опасно. Я это делаю только для целей демонстрации. Если вы не понимаете риски этого, лучше не включайте такой режим. Лучше лишний раз спросите, что происходит. Всё, вот такую вот задачу отдали, и она пошла работать. Поехали. Ну что, кодекс сразу же понял задачу собрать MVP локального десктоп диктофона. Он так назвал такой класс софта. Горячая клавиша, компактный индикатор записи с уровнем сигнала, потоковое распознавание с помощью модели, вставка текста в активное поле. Я описал задачу, на самом деле, не как бизнес-заказчик, а как полный дилетант. Программистам так задачи ставить нельзя. Поэтому здесь кодекс на первом этапе выступает в качестве project такого менеджера, продакт-менеджера, переводчика. с человеческого языка на язык продуктов программных и разработки. Мне нравится то, что я вижу. Посмотрим, насколько быстро это сработает. Модель от Сбера Gig AM рассчитана на фразы до 25 секунд. Он этот смысл сам уловил по ссылке и сейчас архитектуру приложение разработает так, чтобы, видимо, кусочками по несколько секунд звуковые файлы в модель отдавать и не превышать вот этот вот порог. Запускаем второе окошко Visual Studio CД параллельно. Эээ, переключаемся в папочку Fable для того, чтобы новый проект создать. Здесь у меня будет работать-код, и клодкод будет делать точно такую же задачу. Переключаемся в clД-код. Здесь у меня effort. Давайте поставим тоже максимальный ультракод. Модель используется в Fable 5 и режим разрешений. Я тоже делаю bypass Permissions, то есть делай всё полностью самостоятельно. Для частоты эксперимента я копирую полностью промт и вставляю сюда промт точно такой же. Единственное, что я добавлю, я за кадром добавил это в кодекс. Ещё когда закончишь, посчитай, пожалуйста, сколько времени у тебя ушло на решение этой задачи, сколько токенов на эту задачу ушло и сколько бы стоили эти токены, если бы я использовал их через API. Вот такое вот дополнение я хочу сделать, чтобы мы не только сравнили итоговый результат, но и стоимость этого итогового результата для частоты эксперимента. Поехали. Так, ну что? Вот что нам говорит Антропик. Он хочет разобраться с окружением API модели Gig AM версии 3, потом собрать лёгкое [откашливается] приложение для Макос, ходкей кнопка, всплывающее окошко с индикатором уровня звука, локальное распознавание на Литу, вставка текста в активное приложение. Пока что рассуждение выглядит очень близко к кодексу. Не могу для себя определить, кто задачу понял мою лучше. выглядит одинаково хорошо. Честно говоря, СОЛ начал работу чуть раньше. Что он решил, что я буду делать распознавание голоса самостоятельно кнопкой Option Space с включением и выключением записи. Э паузы автоматически закрывают фразы короче 25 секунд. Э распознаются по очереди. Это даст псевдостриминг без обещаний несуществующего официальным API. Ну, здорово, что вот он пошёл создавать уже Swift приложение. Как вы видите, вот здесь вот слева в моей папочке Sol начали появляться файлы какие-то, э, скрипты. Я ничего не понимаю в программировании. Ну, конечно, я отличу мегабайты от мегабургера. Всё-таки я занимаюсь IT больше 15 лет, но я занимаюсь им как продакт-менеджер, как управленец, как маркетолог, как продавец, как руководитель, как стратег. Я никогда не писал серьёзный код за пределами каких-то вот школьных продвинутых программ, поэтому кое-что в этом мне понятно, но самостоятельно я, конечно же, никогда ничего подобного бы не сделал. Так, ну что, друзья, Иклодкод, и кодекс
РЕЗУЛЬТАТ: 57 минут и $46 против $165 и двух десятков итераций
завершили работу. Давайте посмотрим, что у нас получилось. Значит, во-первых, почитаем документацию проектную, которую сделал кодекс. Он назвал мне программу Sol по названию модели. лёгкое меню бар приложение для локальной русской диктовки на MacOS. Нажмите глобальную горячую клавишу. Будет происходить распознавание моделью гига. Напоминаю, что эта модель установлена локально. Мне не нужно никакой связь в интернете. Вот здесь описано, как работает эта программа. Из интересного, что я хочу отметить, вот что. Значит, что суммарное время работы GPT 5. 6 S на самых максимальных настройках составила 57 минут 6 секунд. Мне это, честно говоря, очень понравилось. У меня была небольшая доработочка в начале очень маленький был глюк, который я просто попросил добавить. И вот что хочу отметить, что если бы я не подпиской пользовался CH GPT Pro за 20 баксов, который кодекс этой последней версии доступен с огромными лимитами, а покупал бы токены через API официальной платформы Open AI, тогда мне это приложение обошлось бы в 46 долларов и сколько-то там центов. То же самое сделал приложение для меня Fable. Проектная документация тоже написана неплохо, но что бы я хотел отметить. Значит, что активной работы у меня ушло примерно 4 часа. И вот это меня поразило очень сильно. Первая версия приложения была сделана примерно на час, примерно так же, как и у кодекса. И стоила она примерно столько же, 51 доллар в токенах. А дальше у меня ушло пара десятков и отераций, потому что приложение глючило, не хотело запускаться. И в совокупности у меня ушло где-то где где 165 долларов в токенах, если пересчитать. Ну, это, конечно же, я тоже делал внутри подписки. Никакие токены у меня не закончились, поэтому, ну, вот такая вот история. Смотрите сами. Значит, первый как бы раунд этого испытания остался точно совершенно за GPT 5. 6. сделано быстрее, сделано эффективнее, сделано за разное количество итераций. Что надо отметить про это? Значит, что, во-первых, я не профессиональный разработчик, я не программист, я использовал обе модели не так, как используют программисты. Программисты работают с моделями совершенно по-другому. Я сделал простенький промпт, вы его видели, я сказал: "Сделай мне хорошо". Грубо говоря, так делают пользователи дилетанты. У программистов, которые понимают, как устроена архитектура приложений, как писать правильный ТЗ, как делать правильный spec Driven Development, результаты могли быть совершенно другие. Во-вторых, я делал это на режиме самых максимальных настроек для такой простой задачи - это overkill. Но тем не менее в моём тесте первый раунд за GPT 5. 6 Soul Fable здесь проиграл. Давайте посмотрим, как выглядят сами приложения, и потестируем их. Э, первым делом хочу запустить приложение, которое я навайпкодил в начале 2026 года, которое послужило вдохновителем для этого видео. Я как-то сам не заметил, как собрал р Flow аналог для себя и просто стал его использовать. Как же выглядит это
Живой тест трёх приложений-диктофонов
приложение? Первое, которое я сделал на модели Opus 4. 7, наверное, уже пару поколений получается назад. Я зажимаю горячую клавишу, я держу её и в этот момент начинаю что-то диктовать. Видите, у меня сейчас на экране появляется э индикатор записи. Это значит, что запись пошла. Ну вот что-то я наговорил. Отпускаю эту кнопку. Несколько секунд проходит, и у меня появляется текст, который я только что произносил. Работает хорошо, работает довольно быстро, но не локально. Это приложение обращается к API эйронке, которая называется WISPER, которая находится в официальном API Open AI. Извините, что столько AI в одном приложении. Ну, короче, это мне стоит [фыркает] сколько-то центов, наверное, меньше доллара на все мои наговаривания. за месяц в токенах распознавания голоса. Итак, тестируем приложение номер один, который мы сегодня навайпкодили. Нажимаю горячую клавишу. У меня появляется индикатор. Обратите внимание, что этот индикатор показывает, когда я говорю, и ничего не показывает, когда я молчу. Распознаваемый текст появляется снова. Кнопку я не держу. Приложение, вернее, нейронка сама решила сделать вот эту плашку такой. Распознавание происходит на лету. При этом оно происходит локально на моём ноутбуке с процессором 2 Apple и 16 гигами оперативной памяти практически в реальном времени. Чтобы текст вставился в активное поле, мне надо нажать клавишу ту же самую горячую. Ещё раз всё. Вот этот вот текст вставился. Сравните с тем, что сделал OPUS 4. 7 полгода назад. Мне кажется, что выглядит всё очень хорошо. Качество распознавания текста, знаки припинания. мысли. Ну что, мне нравится, всё здорово здесь. И второе приложение, которое мы навайпкодили сегодня, тоже нажимаю на горячую клавишу. Вот видите, окошко выглядит чуть-чуть хуже на белом фоне. Если я сейчас переключусь на VS-код, то вот здесь вот оно выглядит нормально, да, но вот на белом фоне оно выглядит плохо. Здесь вот видны уголочки. Это всё решается одной доработкой. Я просто должен нейронке сказать: "Слушай, что-то вот так вот оно выглядит, пожалуйста, поправь. Это будет исправлено в одну итерацию". Но тем не менее небольшой косячок засчитываем визуальный. Сейчас посмотрим на качество распознавания 30 секунд. Почему я так долго говорю? Потому что модель от Сбера по распознаванию голоса. Всё это можно завершить, пускай вставляет. Кстати говоря, да, вставилась тоже очень быстро. Модель от Сбера не предназначена для кусков текста больше 25 секунд. Поэтому я и первому, и второму приложению наговаривал больше, чем 25 секунд, чтобы посмотреть, что всё сработает корректно, но всё супер. Раскрываю карты. Приложение номер два. За приложение номер два отвечает нейронка Fable 5. За приложение номер три отвечает GPT 5. 6 S. Что ещё я бы хотел показать? Приложение, которое сделало Fable, выглядит вот так. Это слово Fable с микрофончиком, которое висит в трее. Я могу здесь назначить клавишу записи, я могу выбрать микрофон из тех, которые ко мне подключены. Есть ещё какие-то настроечки. Приложение, которое сделал Сол, выглядит вот так. То же самое. Есть
Вердикт первого раунда и удар по облачным сервисам
настройка горячей клавиши, всяческие разрешения, которые надо выделить операционной системе, чтобы оно работало. Но вот это вот приложение моё старое аналог Woflow, где нужно ввести ключ копии для внешнего сервиса распознавания. Я считаю, что в этом тесте безоговорочную победу одерживает модель GPT 5. 6 Sol. Она отработала быстрее, она отработала дешевле. Качество работы меня полностью устраивает. Есть визуальный косячок, но Fable приложение не работало. Мне потребовалось два десятка итераций доработки, прежде чем оно начало работать, как я ожидаю. Что я хотел сказать этим видео? Я хотел вам сказать, что разработка софта, разработка облачных сервисов постепенно умирают. Капитализации всех крупнейших IT-компаний, облачных сервисов американских просто рухнули на 70%. И вот почему я вам только что показал, как дилетант, не программист. Я отношу себя к опытным пользователям, не к разработчикам, не к инженерам. с помощью одного промта на естественном языке сделай мне аналог WHP Flow. Получил работающее приложение практически бесплатно. Это всё влезет в подписку за 20 баксов. Оно работает локально. Оно распознаёт текст хорошо. Через год, через два мы все с вами сможем сказать: "Э, ну-ка, Клод" или кто там будет в лидерах Кодекс или ещё те, кто даже не появились на этом рынке. Сделай мне, пожалуйста, AMCRM, сделай мне, пожалуйста, Bitrix24, сделай мне, пожалуйста, любую IT-компанию, которая сейчас стоит в топе. И она также будет за один промт и потом ещё с парочкой итерацией доработок косячков реализовывать для вас абсолютно любые ITшения, ровно так, как я вам это сейчас показал. Напишите в комментариях, что думаете, какая модель больше нравится вам, какие проекты вы делали. Я хочу сделать второй раунд испытания GPT
Финал: анонс второго раунда — сайт и 3D-игра
5. 6 Soul против Fable 5 на максимальных настройках и сделать с их помощью ещё веб-сайт небольшую трёхмерную игру. Оставьте комментарии, если думаете, что это классная идея, и ждёте следующий выпуск. А я с вами увижусь в следующем видео. Пока-пока.
Другие видео автора — Action Plan | Николай Хлебинский