Можна як чернетку розбору. Модель часто витягне з фото чека або скріна з Telegram поля й запропонує текст. Бізнесова відповідь довша: будь-яке число, яке піде клієнту, в оплату або в облік, людина звіряє з оригіналом пальцем по екрану. Текст, таблиця, фото й скрін - різні входи, і в кожного свій профіль помилок. Розпізнавання зображення додає окремий шар збоїв: погано прочитана цифра, плутанина 8 і 0, обрізаний край суми, чужий рядок у кадрі.
Курʼєрський ранок на складі. Менеджер фотографує ТТН і просить у чаті: витягни поля і напиши клієнту статус. Модель повертає ПІБ, місто й трек-номер. Одне число в телефоні клієнта переплутане. Повідомлення вже майже пішло в Telegram. Ловить помилку лише той, хто звірив трек і телефон з паперовим або екранним оригіналом, а не з впевненістю розпізнавання. ШІ читає ТТН з фото не як ідеальний банківський сканер, а як ймовірнісний читач. Де ціна помилки висока, очі людини лишаються в процесі за правилом, а не за натхненням.
Коротко
- Фото чека й скрін з Telegram технічно часто можна кидати в чат; бізнесово це чернетка, не фінал.
- OCR помиляється на блику, куті, дрібному шрифті й мʼятому папері: сума, трек, телефон і код відділення - зона ризику.
- Текст контролюється посимвольно; таблиця чутлива до брудних заголовків і зайвих підсумків; зображення додає шар розпізнавання.
- На скріні часто видно зайві персональні дані: обріжте кадр або перепишіть три потрібні рядки вручну.
- Перед клієнтом, платежем і відправкою статусу ТТН кожну критичну цифру звіряє людина з оригіналом.
Різні входи - різні помилки
Текстовий вхід найзручніший для контролю, бо ви бачите кожен символ, який відправили в модель. Помилки тут частіше логічні: вигадка факту, пропуск обмеження, розмитий формат, зайва обіцянка. Табличний вхід з CSV або Excel сильний для структури й зведень, але чутливий до брудних заголовків, обʼєднаних клітинок, прихованих фільтрів і зайвих підсумкових рядків. Модель може зчитати не той діапазон або прийняти форматування за зміст. Для критичних сум давайте чистий зріз або явно називайте аркуш і діапазон у промпті.
Фото чека і накладної додають шар OCR, тобто оптичного розпізнавання символів. OCR помиляється на мʼятому папері, на дрібному шрифті, на відблисках екрана смартфона, на кадрі під кутом, на тіні від руки. Сума 1500 може стати 7500. Код відділення може втратити одну цифру. Дата може розвернутись місцями. Тому правило для підприємця звучить жорстко і по-доброму: модель допомагає зібрати поля швидше. Вона не знімає відповідальності за цифру.
Конфіденційність скріна, про яку забувають у поспіху
Скрін з Telegram і скрін виписки з банку мають ще вимір конфіденційності. На скріні часто видно імʼя клієнта, фрагмент картки, баланс, сусідні платежі, сторонні повідомлення, номери телефонів, аватари. Перед завантаженням у публічний чат обріжте зайве або затріть чутливе. Іноді безпечніше переписати вручну три рядки виписки звичайним текстом, ніж відправляти повний екран. Так ви розвʼязуєте задачу пояснення платежу без зайвого витоку персональних даних.
Якщо треба розібрати багато рядків, експортуйте таблицю і працюйте з нею в контрольованішому контурі, а не через двадцять скрінів у безкоштовний веб-чат. Повна виписка місяця з орендою, зарплатами й особистими переводами не повинна їхати в публічне вікно лише тому, що "так швидше".
Як ловити помилки розпізнавання цифр
Помилки OCR ловляться тим самим духом, що й текстові вигадки, лише з акцентом на джерело-зображення. Підкреслили всі числа у відповіді моделі. Відкрили фото поруч. Звірили посимвольно. Особливо уважно телефони, трек-номери, суми, довгі розрахункові рахунки, коди відділень Нової Пошти. Якщо якість фото низька - перефоткайте документ або введіть критичне поле руками. Повторний запит "подивись уважніше" інколи допомагає, інколи дає нову впевнену помилку. У сумніві перемагають очі людини.
Коли очі людини обовʼязкові без дискусії. Платіж. Післяплата. Будь-яка сума в листі клієнту. Номер ТТН перед відправкою статусу. Податкові й договірні цифри. Якщо в кадрі раптом опинились медичні чи дитячі дані - краще не класти таке зображення в публічний чат узагалі. Коли можна швидше опиратись на чернетку з фото: внутрішня класифікація чека для бухгалтера з подальшою перевіркою; начерк списку полів, які ще треба дозаповнити в кабінеті. Фінальний підпис усе одно людський.
Ритуал на менше ніж хвилину
Практичний ритуал для команди логістики займає менше хвилини після звички. Фото ТТН або екрана кабінету. Запит моделі витягнути поля списком. Менеджер ставить галочки на треку, телефоні, місті, післяплаті. Лише після галочок зʼявляється текст клієнту. Якщо галочки немає - повідомлення не існує в природі процесу. Цей ритуал гасить спокусу сказати "модель же бачить, навіщо звіряти". Бачить ймовірнісно. Звіряєте і підписуєте ви.
Для фінансів ритуал схожий за духом. Скрін попередньо обрізаний до одного потрібного платежу. Модель пропонує категорію витрат і короткий опис. Людина підтверджує категорію в таблиці або в обліковій системі. У публічний чат не їде зайве.
Окремо про якість кадру як частину входу. Тримайте телефон паралельно до документа. Приберіть блиск. Обріжте чужі дані ще до завантаження. Якщо в кадрі два чеки поруч, модель може змішати суми. Якщо папір зімʼятий саме по рядку телефону, введіть телефон руками і не сперечайтесь з OCR. Рукописні помітки поверх друкованої накладної - окрема пастка: модель може прочитати рукопис хибно або прийняти службову позначку за офіційне поле. Для клієнтського тексту такі позначки краще прибрати з кадру. Для внутрішнього розбору прямо скажіть у промпті: ігноруй рукописні помітки, бери лише друковані поля документа.
Керівник додає в політику один короткий рядок: зображення з цифрами означає обовʼязкову людську звірку перед клієнтом або платежем. Це дешевше за довгі суперечки про якість камери на складі. Інвестор і замовник продукту з "розумним читанням документів" питають про рівень помилок на цифрах і про наявність human review. Демо на ідеальному скані не дорівнює фото з телефона комірника під вечірнім світлом у реальному процесі.
Чому "модель же бачить" - поганий аргумент для процесу
Формула "модель же бачить" зʼявляється саме тоді, коли команді шкода хвилини на звірку. На екрані вже є готовий абзац для клієнта, трек виглядає схожим на справжній, телефон має правильну кількість цифр. Візуальна правдоподібність роззброює. Але бачення моделі - це ймовірнісне читання пікселів і подальше складання тексту, а не гарантований банківський сканер. Різниця стає видимою лише в момент інциденту: клієнт не отримує SMS, відділення не те, післяплата інша.
Тому я пропоную оцінювати фото-вхід не за красою відповіді, а за ціною помилки поля. Якщо помилка в місті доставки коштує день логістики й нерви клієнта, поле "місто" у списку галочок стоїть вище за тон повідомлення. Якщо помилка в сумі чека для внутрішньої класифікації витрат коштує лише правку бухгалтера наступного дня, чернетку можна брати швидше, але фінальна категорія все одно підтверджується людиною. Одне й те саме фото чека в різних процесах має різний стандарт перевірки.
Окремо варто домовитись про мову всередині команди. Замість "ШІ прочитав" кажіть "модель запропонувала поля". Замість "можна відправляти" - "галочки стоять". Ця дрібниця змінює поведінку швидше за довгий регламент: вона нагадує, що між розпізнаванням і відправкою є людський підпис.
Що робити зі змішаними входами в одній розмові
Типова пастка малого бізнесу - кинути в один чат і фото ТТН, і скрін з Telegram, і шматок таблиці Excel, і довгий коментар менеджера. Модель може змішати поля з різних джерел: взяти телефон зі скріна листування, а місто з накладної іншого замовлення, яке випадково потрапило в кадр. Чим більше різнорідних входів, тим вищою має бути дисципліна запиту.
Практичне правило: один документ - один короткий запит на витяг полів. Окремо - складання тексту клієнту вже з підтвердженого списку. Не просіть за один прохід "прочитай усе і одразу напиши клієнту готове". Розділіть читання й відправку. Це додає тридцять секунд і знімає половину змішаних помилок, які я бачу в розборах інцидентів.
Якщо документ довгий або якість кадру сумнівна, спочатку попросіть модель перелічити, які поля вона бачить упевнено, а які читає погано. Там, де вона сама сумнівається, вводьте руками. Чесний список сумнівів цінніший за впевнений повний набір із однією тихою помилкою всередині.
Типовий складський збій, який варто проговорити з командою заздалегідь, - кілька документів в одному кадрі або рукописна стрілка "терміново" поверх друкованого поля. Модель може злити суми двох чеків або прийняти службову позначку за офіційне значення післяплати. Перед завантаженням приберіть зайве з кадру. Якщо прибрати неможливо, у промпті прямо напишіть, який саме документ головний і що ігнорувати.
Що робити далі
- Візьміть одне реальне фото ТТН або чека, попросіть модель витягти поля списком і підтвердіть кожну критичну цифру пальцем по оригіналу до будь-якого Send.
- Додайте в процес логістики галочки: трек, телефон, місто, післяплата - і забороніть відправку клієнту без них.
- Перед завантаженням скріна з Telegram або виписки обрізайте кадр до потрібних рядків або переписуйте три поля вручну текстом.
- Для таблиць із сумами передавайте чистий зріз і в промпті називайте аркуш і діапазон; не змішуйте підсумкові рядки з даними.
- Запишіть у внутрішню політику один рядок: будь-яке зображення з цифрами = людська звірка перед клієнтом, платежем або зміною в кабінеті перевізника.
Про цей матеріал
Це навчальна нотатка про різні типи входу в мовну модель і профілі помилок, зокрема OCR на фото чека й скрінах з месенджера. Сцени зі складу й ТТН узагальнені; цифри в прикладах ілюстративні. Текст не замінює політику захисту персональних даних і не є інструкцією з налаштування конкретного продукту: відповідальність за цифру перед клієнтом лишається на людині в процесі.

