стаття

TypeSafe Jev відповідає лише так або ні, і цього вистачає для перевірок

Про TypeSafe Jev від TypeSafe AI останній тиждень пишуть усі, а я мовчав свідомо: ми одразу поставили модель на реальні продукти і чекали, поки зʼявляться результати, про які варто говорити, а не переказ анонсу. Тепер вони є. Для задач, де відповідь має бути зі списку варіантів, класифікатор швидший і дешевший за велику мовну модель. І головне: він фізично не може вигадати те, чого в документі нема.

АвторМихайло ПацанІнвестор · Підприємець
Профіль автора
Обкладинка: TypeSafe Jev відповідає лише так або ні, і цього вистачає для перевірок
Jev від TypeSafe AI: класифікатор System One для перевірок так або ні

Про TypeSafe Jev від TypeSafe AI останній тиждень пишуть усі, а я мовчав свідомо: ми одразу поставили модель на реальні продукти і чекали, поки зʼявляться результати, про які варто говорити, а не переказ анонсу. Тепер вони є. Для задач, де відповідь має бути зі списку варіантів, класифікатор швидший і дешевший за велику мовну модель. І головне: він фізично не може вигадати те, чого в документі нема.

Коротко

  • TypeSafe Jev - модель System One від TypeSafe AI: не пише текст, а відповідає на питання з наперед відомими варіантами і додає впевненість у відсотках.
  • Засновник компанії - Діогу Алмейда, один із людей, які в OpenAI придумали RLHF, метод навчання, що зробив із мовної моделі ChatGPT.
  • За цифрами TypeSafe модель у 40-200 разів швидша за ChatGPT чи Claude на таких задачах, коштує 4 центи за мільйон вхідних токенів, а вихідні безкоштовні.
  • У Kontragents.com питання так або ні і шкали ризику забирає TypeSafe Jev; велика модель пише лише підсумковий висновок для людини.
  • У контролі якості дзвінків і листування TypeSafe Jev проганяє кожну розмову за контрольним списком, а резюме робить лише там, де відповіді насторожили.
  • Поріг вище 90 відсотків - агент діє сам, нижче - задача летить людині. На власному тесті TypeSafe точність близько 68 відсотків, тож поріг впевненості важить більше за саму точність.

Проблема, яку велика модель закриває дорого

У будь-якій фінансовій компанії є задачі, де одне й те саме питання ставиться тисячі разів на день. Служба безпеки перевіряє контрагента і мусить із кількох десятків сторінок реєстрів, судових справ і звітності відповісти на десятки однакових питань: чи є податковий борг, чи компанія відповідач у судових спорах, чи змінювався власник за останній рік, чи є звʼязок із санкційними особами.

Кол-центр кредитної чи страхової компанії щодня записує сотні розмов і листувань, і кожне треба перевірити за одним списком: чи клієнт скаржиться, чи менеджер назвав повну вартість, чи прозвучала обіцянка, якої немає в договорі.

До появи мовних моделей це читали люди і встигали переглянути вибірково. Останні два роки це читає велика модель. Велика мовна модель - це система, яка генерує текст: пояснення, резюме, лист. На перевірках так або ні вона часто зайва. На кожен дзвінок і кожного контрагента вона заново перечитує інструкцію на кілька сторінок, думає кілька секунд, коштує реальних грошей. Час від часу вона ще й впевнено відповідає щось, чого в документі нема. Тому за нею все одно стоїть людина, яка перечитує.

Саме тут зʼявляється місце для класифікатора. Класифікатор - модель, яка не пише абзац, а вибирає відповідь зі списку, який дали ви. Питання закрите, варіанти відомі заздалегідь, фантазія не потрібна.

Що таке TypeSafe Jev і модель System One

15 вересня TypeSafe AI показала Jev, побудовану саме під це. Ви даєте їй документ або транскрипт і список питань із наперед відомими варіантами відповідей, а вона за долі секунди відповідає на всі одразу і до кожної відповіді додає впевненість у відсотках.

TypeSafe називає це моделлю System One, за Канеманом: швидка інтуїція замість повільного міркування. У книзі "Мислення швидке й повільне" Даніель Канеман розділив думку на дві системи. System One - швидка, майже автоматична. System Two - повільна, зважена. Велика мовна модель часто грає в System Two: довго міркує і пише. TypeSafe Jev свідомо грає в System One: дивиться на документ і каже "так", "ні" або інший варіант зі списку.

RLHF тут варто пояснити одним реченням. Reinforcement Learning from Human Feedback - навчання з підкріпленням за відгуками людей. Саме цей підхід зробив із сирої мовної моделі ChatGPT, який люди готові читати. Алмейда був серед тих, хто цей метод будував у OpenAI. Тепер він застосував досвід до вужчої задачі: не розмова, а класифікація з відомою шкалою відповідей.

За їхніми цифрами модель у 40-200 разів швидша за ChatGPT чи Claude на таких задачах, коштує 4 центи за мільйон вхідних токенів, а вихідні безкоштовні. Вигадати відповідь вона фізично неспроможна, бо вибирає лише зі списку варіантів, який дали ви. Поза списком відповіді просто нема. Це вже не обіцянка "менше галюцинацій", а межа архітектури.

Kontragents.com: перевірка без вигаданих фактів

У Kontragents.com кожна перевірка проходить по десятках критеріїв ризику, і раніше всі вони йшли через велику модель. Тепер питання так або ні і всі шкали ризику забирає TypeSafe Jev: реєстри, судові справи і звʼязки оцінюються за секунду й копійки на компанію, а велика модель пише лише підсумковий висновок для людини, яка ухвалює рішення про угоду.

Перевірка стала швидшою і дешевшою в рази. Випадки, коли модель приписувала компанії те, чого в документах нема, зникли, бо варіант поза списком TypeSafe Jev видати неспроможна. Для підприємця, який щодня дивиться на контрагентів перед угодою, це різниця між історією, яку намалювала модель, і відповіддю на закритий список.

Людина лишається там, де рухаються гроші: вона читає підсумок і вирішує, чи йти в угоду. TypeSafe Jev не підписує рішення. Вона сортує факти перед людиною. Угода, платіж і відповідальність лишаються на стороні, яка має право їх нести.

Контроль якості дзвінків: слухати те, що варто

У системі контролю якості дзвінків, переписок і листування TypeSafe Jev проганяє кожну розмову за списком контрольних питань, а велика модель робить резюме лише тих, де відповіді насторожили. Керівник відділу отримує рівно ті діалоги, які треба послухати, замість вибірки з десяти відсотків.

Раніше вибірковість була компромісом із часом: люди фізично не встигали прослухати все. Тепер вибірковість інша. Спочатку класифікатор проходить увесь потік. Потім людина слухає те, що класифікатор відмітив як ризикове або невпевнене. Це змінює роль керівника: менше випадкової вибірки, більше уваги до місць, де вже є сигнал.

Для команди кол-центру це також змінює розмову про якість. Замість "ми послухали десять відсотків і сподіваємось" зʼявляється "ми прогнали сто відсотків через контрольний список і слухаємо те, що випало". Контрольний список лишається вашим: які питання важливі, вирішуєте ви, а не модель.

Де ще стоїть та сама задача

Це два приклади, які вже видно назовні, а всередині таких місць набагато більше. Маршрутизація вхідних листів і заявок. Відсів спаму й дублікатів. Перевірка, чи заповнені всі поля в документі. Вибір, яку велику модель запускати під конкретний запит, а яку задачу взагалі закрити без неї. Оцінка, чи відповідь агента можна відправляти клієнту або спочатку показати людині.

Кожен з цих кроків - питання з відомими варіантами відповіді. Кожен зараз або коштує запуск дорогої моделі, або тримається на людині. Класифікатор не замінює людину і не замінює велику модель. Він знімає з них роботу, яку вони роблять занадто дорого і з надлишком фантазії.

Якщо подивитися на типовий день підприємця, таких "закритих" питань більше, ніж здається. Чи цей лист - нова заявка, чи повтор старої. Чи в договорі заповнене поле про строк. Чи менеджер уже відправив клієнту чернетку, яку варто ще раз прочитати людині. Усі ці місця добре тримає класифікатор, а велика модель лишається для тексту, який справді треба написати.

Впевненість біля кожної відповіді

Найкорисніша деталь для нас у TypeSafe Jev - впевненість біля кожної відповіді. Я давно пишу, що людина має стояти там, де рухаються гроші. Тут це вбудовано: впевненість вища за 90 відсотків - агент діє сам, нижча - задача летить людині.

Раніше цей поріг ми домальовували вручну у кожному впровадженні. Тепер він частина моделі. Сам по собі цей відсоток не гарантує правильності: він лише показує, наскільки модель певна у вибраному варіанті. Висока впевненість на помилковому варіанті все одно можлива, тому поріг працює разом із вузьким списком відповідей і з людиною на виході.

Межі теж видно: TypeSafe Jev нічого не напише, не пояснить і не порозмовляє з клієнтом. Висновок по контрагенту і звіт по дзвінках лишаються за великими моделями. TypeSafe Jev працює сортувальником перед ними.

На власному тесті TypeSafe визнає точність близько 68 відсотків, на рівні середніх моделей. Саме тому поріг впевненості важить більше за саму точність: сумнівні випадки йдуть людині, решта проходить сама. Для бізнесу це зручна чесність. Модель не обіцяє ідеал. Вона дає швидкий відбір і показує, де сумнівається.

Наступний крок для нас - виміряти все це в грошах і секундах на повному місячному обсязі. Поки цифри TypeSafe і наші перші продукти збігаються в головному: там, де відповідь уже зі списку, класифікатор знімає з великої моделі зайву роботу і прибирає шлях до вигаданого факту.

Що робити далі

  1. Випишіть три задачі з вашого тижня, де відповідь уже має бути зі списку: так/ні, рівень ризику, "передати людині / відправити клієнту".
  2. Для кожної задачі запишіть сам список варіантів і джерело правди: реєстр, договір, транскрипт, таблиця полів.
  3. Окремо позначте, де зараз стоїть велика модель або людина, і що саме вони роблять зайвого: пишуть текст там, де потрібна лише позначка.
  4. Поставте робочий поріг впевненості: вище 90 відсотків - дія автоматична, нижче - черга людині. Не запускайте без черги.
  5. Залиште великій моделі тільки підсумок і текст для людини. Класифікацію так або ні віддайте моделі, яка вибирає зі списку.
  6. Через два тижні порівняйте три числа: час на одну перевірку, вартість токенів, кількість випадків, коли модель приписала факт поза документами.

Попросіть Лева пояснити окрему тезу, порівняти підходи або застосувати ідею до вашої ситуації. Для особистої консультації залиште заявку.

Розібрати цей матеріал із ЛевомЗалишити заявку

Надіслати запит на консультацію

Опишіть задачу, бажаний результат і терміни. Вам відповість людина.