Машинные алгоритмы часто сглаживают края, предельно усредняя и оптимизируя речь, превращая уникальный голос в богатые эпитетами, но предсказуемые, «безопасные» тексты, теряющие изюминку. Большие языковые модели и детекторы, обученные на гигантских гуманитарных корпусах, видят в ими же созданном контенте человеческую прозу из-за знакомых шаблонов. Драматургическая и лексическая экспрессивность, шероховатость, «неправильность» им «не по зубам». А человек, в свою очередь, узрев сложные конструкции, принимает их за генерацию.
Массовое письмо сливается с машинным, причём, не только по происхождению, но и, что иронично, по подражанию — читая материалы, созданные моделями ИИ, люди впитывают их ритм и начинают писать так же, ассимилируя стиль. Возникает порочный круг сомнений, где подлинность становится просто невозможной для проверки. Ни один детектор ИИ, даже самый первоклассный, «с минимальным количеством ложных срабатываний» (по собственному опыту и тысячам тестов), не может однозначно классифицировать входные данные и выдать точный вердикт. Намечаются (и уже кое-где применяются) скрытые маркировки по математическим распределениям в текстах output.
Даже при исправленных человеком оборотах или замене некоторых слов можно заметить синтетическую природу текста, обратив внимание на совокупность нескольких факторов:
✎ калька с английских синтаксиса и семантики;
✎ неверные отрицания или нелогичные сравнения;
✎ частые антитезы через параллелизмы и анафоры;
✎ парцелляции;
✎ чрезмерные оговорки и пояснения там, где автор мог бы оставить недосказанность;
✎ избегание сложных, неравномерных конструкций построения предложений (многочленные с тремя и более предикативными частями/односложные + причастные/деепричастные обороты). Текст получается «среднеарифметическим» по длине;
✎ избыток канцелярита, списков, вводных слов и сочетаний;
✎ определённые батчи, временно завышающие метрики синтетики из-за специфики генерации (выравнивание, низкая перплексия, температура с некорректными параметрами сэмплинга, где логиты перекашиваются в сторону топ-1 токена) или артефактов группировки данных;
✎ гладкость ритма, приторность формулировок и так далее.Хорошая редактура может сделать текст гладким и практически неотличимым от сгенерированного (особенно если часть правок вносилась ИИ), поэтому к выводам детектеров надо относиться осторожно, учитывая контекст: например, историю работы над текстом, логику и стиль автора.
Если говорить откровенно, то лично для меня ценность текстов сохраняется в способе создавать художественный мир или выбирать материал, демонстрировать своё уникальное видение, мышление и непременно логику.
В этом форуме я постараюсь объяснить, почему качественный текст человека может быть ошибочно принят за генерацию, и наоборот. Отдельно хочу говорить о работе с ИИ так, чтобы он был лишь бустом — усиливал авторский голос и помогал в процессе, оставляя за автором право на выбор решений, на выводы или стиль письма. Право на самостоятельность. Давайте сохранять индивидуальность и не поддаваться на заманчивую простоту нейрослопа.
Предисловие.
Страница: 1
Тема закрыта
Сообщений 1 страница 1 из 1
Поделиться12026-09-11 14:27:27
Тема закрыта
Страница: 1