Зображення ChatGPT 1.5: Це великий стрибок OpenAI у сфері зображень

  • ChatGPT Images запускає модель GPT Image 1.5, яка до чотирьох разів швидша та має краще відстеження інструкцій.
  • Новий інструмент дозволяє точно редагувати завантажені фотографії, зберігаючи освітлення, композицію та риси обличчя.
  • Помітне покращення у генерації тексту на зображеннях та у складних сценах з багатьма обличчями або дрібними деталями.
  • OpenAI запускає власний розділ зображень у ChatGPT, який тепер доступний більшості користувачів через API.

Зображення ChatGPT

Генерація зображень за допомогою штучного інтелекту стала однією з найпомітніших вітрин перегонів між технологічними гігантами. OpenAI вирішив зробити крок з глибоким оновленням Зображення ChatGPT, його інтегровану систему візуального створення, в контексті, де такі моделі, як Nano Banana Pro від Google, домінували в більшій частині розмов.

З цим запуском компанія, що стоїть за ChatGPT, хоче, щоб її інструмент вийшов за рамки простого доповнення до чату та функціонував як повноцінна функція. справжня інтегрована творча студія, швидший, точніший та з інтерфейсом, розробленим з нуля для роботи із зображеннями, а не лише з текстом.

Нова модель GPT Image 1.5: швидкість і точність як її відмінні риси

Суть оновлення полягає в Зображення GPT 1.5Нова флагманська модель OpenAI для зображень. Компанія стверджує, що може генерувати візуальний контент розміром до у чотири рази швидше ніж у попередній версії, що на практиці особливо помітно в години пік та на мобільних пристроях, де раніше не було рідкістю, коли процес переривався або займав вічність під час зміни програм.

Окрім продуктивності, ключове покращення полягає у відстеженні інструкцій. Система інтерпретує інструкції точніше. складні підказки та точні просторові співвідношеннящоб такі запити, як зміна лише одного об'єкта, коригування освітлення або модифікація одягу людини, більше не спричиняли неочікуваних змін в решті сцени.

OpenAI пояснює, що GPT Image 1.5 навчено зберігати важливі елементи зображення незмінними, такі як ідентичність обличчя, загальна композиція або колірна палітранавіть після кількох раундів послідовного редагування. Цей момент особливо актуальний для професійного використання, де візуальна узгодженість — це не примха, а вимога.

Точкове та ланцюгове редагування: змінюйте лише те, що важливо

Однією з областей, де попередні моделі зазнали невдачі, була цілеспрямоване редагування певних областейЗміна капелюха, налаштування освітлення або додавання елемента до фону може призвести до реміксу всієї сцени. Нові зображення ChatGPT безпосередньо вирішують цю проблему.

Модель здатна додавати, видаляти, об'єднувати, змішувати та транспонувати елементи в межах одного зображення, зберігаючи стабільність усіх інших важливих компонентів. На практиці це означає можливість запитувати такі дії, як: зміна кольору сорочки, модифікація капелюха, коригування дорожнього знаку або перетворення вантажівки на пожежну машину, не спотворюючи решти середовища.

Поведінка під час телефонних дзвінків також була посилена мережеві виданняДосі третя чи четверта зміна зазвичай призводила до повного «переосмислення» зображення моделлю. Завдяки GPT Image 1.5 інструмент набагато надійніше зберігає стиль, позу та сцену, тому ви можете повторювати на тій самій основі, не починаючи з нуля кожну модифікацію.

Творчі перетворення: від селфі до кінопостера

Окрім технічної точності, OpenAI виводить зображення ChatGPT на виразно креативну територію. Система дозволяє користувачам завантажувати власні фотографії та, за допомогою відносно простого запиту, отримувати зображення за лічені секунди. правдоподібні трансформовані версіїВід реклами 90-х до сцени на Таймс-сквер посеред зими чи японського міста з естетикою кіберпанку.

Модель також здатна відтворювати певні художні стилі, як-от класичні кіноафіші, ілюстрації в стилі аніме або композиції з історичним виглядом, що враховують ключові риси оригінальної людини. Ідея полягає в тому, що користувач може «побачити» себе в дуже різних контекстах, не втрачаючи відчуття, що це та сама людина.

Такий підхід нагадує те, що вже пропонували такі моделі, як Nano Banana, але OpenAI намагається диференціювати себе, роблячи ставку на більш контрольовані концептуальні трансформаціїде система зберігає суть базової фотографії, змінюючи одяг, оточення, освітлення чи епоху зі значною візуальною узгодженістю.

Зображення ChatGPT прощаються з жовтуватим стилем та покращують складні сцени

Протягом тривалого часу було відносно легко визначити, чи було зображення створено за допомогою ранніх версій ChatGPT: вони переважали теплі тони, кремові оздоблення та певний жовтий відтінок що виявило його штучне походження. Внутрішні порівняння, проведені OpenAI та незалежними тестами, у порівнянні з такими альтернативами, як Bing Image CreatorЗдається, ця риса залишилася позаду.

Нова модель пропонує більш нейтральний та різноманітний колірний спектрЦе робить зображення більш схожими на звичайні фотографії, якщо користувач явно не запропонує інше у запиті. Це допомагає зображенням виглядати менш «брендованими» та більш корисними в контекстах, де бажаний реалізм або інтеграція з існуючим фотоматеріалом.

Також було внесено покращення до представлення сцени з багатьма дрібними елементаминаприклад, натовпи або фони, багаті на деталі. Обличчя у великих групах тепер чіткіше вирізняються одне від одного, з більш природними позами та виразами, а типові недоліки, такі як відбитки рук, дрібні штрихи або дивні повторення, зменшуються.

ChatGPT Images дозволяє вставляти текст у зображення: вставляти постери, інфографіку та макети

Генерація читабельного тексту всередині зображення історично була однією з ахіллесових п'ят генеративного штучного інтелекту. OpenAI стверджує, що GPT Image 1.5 робить значний крок вперед у цій галузі, завдяки... набагато послідовніше відображення типографіки ніж у попередніх версіях.

Модель може впоратися щільні, невеликі блоки текстуЦе відкриває шлях до створення плакатів, інфографіки, макетів газетних сторінок або дизайну з таблицями та форматами типу Markdown з рівнем читабельності, який, хоча й не ідеальний, але ближчий до чогось корисного без інтенсивного ретушування.

Для тих, хто працює в сфері маркетингу, освіти, електронної комерції або цифрового контенту, це покращення означає скорочення часу, витраченого на виправити неправильно сформовані літери або неповні словаУ контекстах, коли є потреба створювати візуальні матеріали з чіткими повідомленнями, готовими до публікації, той факт, що сама модель генерує досить чистий текст, стає відмінним фактором.

Новий користувацький інтерфейс: окремий розділ зображень у ChatGPT

Оновлення не обмежується лише моделлю; воно також впливає на те, як вона використовується. OpenAI додав нову функцію до бічної панелі ChatGPT. окремий розділ під назвою «Зображення»Це стосується як мобільного додатку, так і веб-версії. Мета полягає в тому, щоб відокремити візуальний досвід від традиційного чату та спростити навігацію для тих, хто не хоче мати проблеми зі складними підказками.

З цього нового простору користувач знаходить попередньо визначені стилі, пропозиції трендів та шаблони Для частих завдань, таких як створення привітань, відновлення старих фотографій, перемикання між різними художніми стилями або створення варіацій одного й того ж продукту, цей підхід знижує поріг входу для людей без технічного досвіду.

Ще один практичний аспект полягає в тому, що розділ «Зображення» діє як централізоване сховище усіх візуальних творінь користувача. Звідти легше переглядати попередні версії, повторювати стиль з новим вмістом або продовжувати редагування вже згенерованого зображення, що особливо корисно в безперервних робочих процесах.

Від привабливого аксесуара до візуального робочого інструменту

Сам OpenAI визнає, що досі генерація зображень у ChatGPT функціонувала радше як надзвичайно привабливий в інтерфейсі, розробленому для тексту який слугує надійним візуальним робочим середовищем. З цим оновленням компанія прагне зробити якісний стрибок: перейти від «тестових» зображень для соціальних мереж до інструменту, який можна використовувати в реальних процесах.

Покращення узгодженості та ітерації має прямий вплив на такі сектори, як дизайн, маркетинг, електронна комерція або брендингКомпанії, яким потрібно адаптувати одну й ту саму креативну концепцію до різних форматів, тестувати варіації продукту або підтримувати узгодженість логотипів та корпоративних елементів у сотнях виробів, отримують явну перевагу в такому типі контролю.

Креативні платформи, що працюють у Європі, такі як веб-редактори та хмарні інструменти дизайнуВони вже інтегрують ці моделі у свої робочі процеси. У цій галузі прагнення OpenAI до більш комплексного візуального середовища може бути корисним як для малих і середніх підприємств, які прагнуть пришвидшити виробництво графічних матеріалів, так і для команд внутрішніх комунікацій у великих корпораціях.

Доступність зображень ChatGPT для користувачів, компаній та розробників

OpenAI почав розгортати нові зображення ChatGPT для більшість користувачів платформи, включаючи тих, хто має безкоштовні облікові записиБагато користувачів вже бачать сповіщення під час відкриття програми із запрошенням спробувати функцію зображення, а також нову спеціальну вкладку в бічному меню для централізації її використання.

У бізнес-секторі компанія підтвердила, що розширений доступ для бізнес-акаунтів та облікових записів підприємств буде впроваджуватися поступово, з акцентом на інтеграції в професійні робочі процесиДля європейських організацій, які вже використовують ChatGPT для внутрішніх завдань, це означає можливість розширити його використання з текстових на графічні матеріали, що генеруються з тими ж обліковими даними.

Паралельно, зображення GPT 1.5 доступне через OpenAI APIЦе дозволяє розробникам інтегрувати можливості створення та редагування зображень у власні програми. Компанія заявляє, що вартість введення та виведення зображень приблизно на 20% нижча, ніж у попередньої моделі, що є значною перевагою для великомасштабних проектів або послуг, що працюють з низькою рентабельністю.

Конкуренція з Nano Banana Pro та іншими візуальними моделями

Крок OpenAI відбувається в період сильного конкурентного тиску. Google наполягає Нано Банан Про як одна з провідних візуальних генеративних моделей, інтегрована в екосистему креативних інструментів та пов'язаний з його Родина Близнюків, що сприяло його поширенню в усьому світі.

Ця ситуація призвела до створення [незрозуміло] деяких конкуруючих служб. суворі обмеження для безкоштовних користувачівНаприклад, шляхом зменшення кількості зображень, які можна генерувати за день, частково через високий попит. Натомість, OpenAI, схоже, робить ставку на поєднання широкого охоплення, більшої швидкості та більш досконалого середовища редагування, щоб утримати та залучити користувачів.

Тим часом інші гравці, такі як xAI зі своїм чат-ботом Grok або різні фахівці з обробки зображень, наполягають на цьому. візуальна генерація стає центральним фронтом у боротьбі за увагу користувачів. Стратегія OpenAI передбачає консолідацію ChatGPT як «все-в-одному додатку», де пошук, голос, текст, зображення та відео співіснують в одній точці входу.

З цими новими зображеннями ChatGPT, OpenAI робить важливий крок до… більш зрілий візуальний інструментШвидша та точніша модель, диференційований інтерфейс та можливості редагування, чітко орієнтовані на реальну роботу, як в особистому, так і в професійному контексті. Залишається з'ясувати, якою мірою ці покращення будуть інтегровані в повсякденне життя користувачів та бізнесу в Іспанії та Європі, але суть зрозуміла: зображення більше не є просто цікавим доповненням до чату, а стало центральним компонентом екосистеми ChatGPT.

ChatGPT створює зображення
Пов'язана стаття:
ChatGPT тепер створює зображення за допомогою GPT-4o: все, що вам потрібно знати

Додати як пріоритетне джерело в Google