Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #304

Judge

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

LearnActCoder (Learn‑Then‑Act): роль‑ориентированная память ошибок повышает F1 для CPT на MIMIC‑III

В preprint (arXiv:2609.19721v1) предложен Learn‑Then‑Act — метод адаптации на этапе вывода, который превращает небольшой размеченный LEARN‑батч в структурированную базу ошибок (MistakeKDB) и направляет уроки в «Coder» (ориентированный на полноту) или «Judge» (ориентированный на точность). Реализация LearnActCoder с табличным привязанием улучшила F1 для CPT/HCPCS на 5.9 процентных пункта на 150 сопоставленных заметках MIMIC‑III, сдвинула кодирование ICD‑10 в сторону большей точности на когорте MIMIC‑IV (с потерей полноты) и сохранила стабильную точку работы на 1 000 отложенных заметок; изменения F1 для ICD не однозначны, оценка ретроспективная, абсолютная точность CPT/HCPCS остаётся низкой.

5.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

GeoSkill: обучение иерархическим навыкам на основе опыта с коллективной ревизией для геопространственных агентов

В статье на arXiv предлагается GeoSkill — система, которая трансформирует исторический опыт выполнения задач геопространственными агентами в Иерархическую Базу Навыков (отдельно для планирования и использования инструментов) и использует коллективный механизм ревизии CTSR с ролями Judge, Critic и Refiner для выявления и исправления дефектов навыков. Авторы утверждают, что GeoSkill обучает и валидирует навыки на этапе разработки, фиксирует базу навыков для доступа только на чтение при деплое и повышает точность выполнения задач и надежность вызовов инструментов на EarthBench и ThinkGeo.

6.0