Сиолошная

В качестве слабостей модели указывают отсутствие критического мышления к своим же выводам. Если напрямую указать, что вот тут ошибка, или же спросить "ты уверена, что вот тут - всё правильно?", то модель исправляется, причем в значимом числе случаев правильно. Уже существуют работы (в том числе и от самих OpenAI) по созданию критиков, которые и играют роль вопрошающих. В теории, нет такого ограничения, которое бы не позволяло к выводам одной модели подсоединять другую такую же, решающую свою подзазачу (критика/упрощение/валидация фактов/прочее).

В разделе математики, например, очень много ошибок (68%) в решении задач приходятся на арифметику. То есть модель правильно подходит к решению, но просто ошибается в вычислении значения выражения. Другие ошибки см. на картинке.

В моём понимании, это не проблема - ведь существуют способы "пришить" калькулятор и другие инструменты (tools) к модели. Как пример - демонстрируется имейл-ассистент, который принимает на вход команду в духе "сделай мне встречу в таком-то кафе с вот этими двумя людьми", и затем сам проверяет ваш календарь, календарь других людей, читает почту и пишет письма (см. картинку). Так умели и модели раньше, просто у меня нет сомнений, что GPT-4 обходит предшественников в понимании использования таких инструментов. И главное тут не требуется никакого дообучения - инструменты описываются прям текстом, например

EMAIL.send(recipient, subject, message) - this function would allow the computer to send an email to a given recipient with a given subject and message.

. Больше про инструменты я писал тут.