← Docs hub

A2A Research Paper Topics

이 문서는 현재 SK-Intellix wiki에 정리된 A2A, Speech-LLM, DeviceAgent TaskManager, memory, context-aware, reactive/proactive 작업을 논문 주제로 분해한 것이다.

Planner와 의미 축 조정, context-aware routing을 외부 연구 프레임과 연결하는 읽기 자료는 A2A Planner Research Reading List에서 본다. 이 문서는 SayCan, LLM-Planner, intent/slot filling, clarification, OOD detection, decision-boundary calibration을 현재 A2A Planner와 매핑한다.

Planner/Runtime/TaskManager의 feedback을 강화학습 유사 개선 루프로 해석하는 기획/구조 관점은 A2A RL-Like Feedback Improvement Opportunities에서 본다.

핵심 관점은 하나다.

현재 작업은 단순 음성 명령 라우터가 아니라, STT 기반 사용자 발화, 과거 대화 맥락, 현재 기기 상태, 실행 중 task event를 함께 해석해 로봇/기기 행동을 계획하는 Speech-LLM 기반 의사결정 제어 계층이다.

1. 전체 논문 포트폴리오

번호 논문 후보 핵심 질문 현재 wiki 근거
1 Context-Aware Agent-to-Agent Planning for Speech-Driven Device Robots STT 발화와 context를 함께 넣으면 agent planning이 어떻게 안정화되는가 Presentation Storyline, Speech-LLM Context-Aware A2A
2 Evidence-Axis Preclassification for Robust LLM Routing LLM 호출 전 deterministic evidence layer가 왜 필요한가 Planner Deep Dive
3 Robust STT_NULL Recovery under Noisy Speech 깨진 STT와 짧은 대화/외부질문 회색지대를 어떻게 구분할 것인가 Planner Deep Dive, benchmark 결과 문서
4 LLM-Planned Multi-Step Device Task Orchestration 복합 음성명령을 ordered step과 device task workflow로 어떻게 변환하는가 Device Task Flow, DeviceAgent TaskManager 기준 사양서
5 DeviceAgent TaskManager as a Unified Execution Framework Cloud/MQTT/App/예약/로컬 음성 명령을 하나의 lifecycle로 관리할 수 있는가 DeviceAgent TaskManager 기준 사양서, SoC TaskManager Framework
6 Event-Driven Replanning for Speech-LLM Robots 모든 task마다 LLM을 호출하지 않고 판단 필요 이벤트에서만 재계획할 수 있는가 Task Event Contract, DeviceAgent TaskManager 기준 사양서
7 Reactive and Proactive Decision Control for Home Robots reactive 발화와 proactive signal을 같은 planner/runtime 철학으로 묶을 수 있는가 Reactive and Proactive Operation
8 Memory-Aware Speech Agent Routing and Personalization 단기/중기/장기 memory가 routing과 응답에 어떤 영향을 주는가 Memory and Personalization, Memory DB and Sync
9 Catalog-Grounded Agent Selection for LLM Orchestration LLM의 tool/agent hallucination을 registry와 candidate pool로 줄일 수 있는가 Planner Deep Dive, Contracts
10 Speech-First Robot Command Benchmark STT noise, fragment, 복합명령, 기기제어, 외부검색을 포함한 benchmark를 어떻게 설계할 것인가 benchmark/evidence 문서, Validation Guide

2. 1순위: 시스템 논문

후보 제목

Context-Aware Agent-to-Agent Planning for Speech-Driven Device Robots

주장

음성 기반 로봇/기기 제어에서 LLM을 단순 intent classifier로 쓰면 STT noise, context continuation, 복합명령, device state constraint를 안정적으로 다루기 어렵다. 이를 해결하기 위해 preclassifier evidence, registry-grounded candidate pool, main planner LLM, second-pass judge, device task runtime을 분리한 A2A planning architecture가 필요하다.

예상 기여

기여 내용
Architecture Speech input에서 agent plan과 device task request까지 이어지는 end-to-end 구조
Context Model 과거 대화/voice context, 현재 device planning context, 미래 변화량 context 방향 제안
Planner Contract turn_mode, selected_routes, steps, input_from, missing_slots, device_task_requests
Runtime Boundary Cloud는 plan과 판단, DeviceAgent는 task execution과 event/reason 관리
Safety Boundary normal event는 local 처리, 실패/차단/재계획 필요 이벤트만 Cloud escalate

실험 설계

실험 비교군 측정 지표
Context ablation text only / voice context / device context / both route accuracy, executable plan validity
Planner contract ablation family only / steps included / dependency included multi-step success, wrong dependency rate
Device context ablation context 없음 / battery-map-task 상태 포함 impossible plan rate, early rejection precision
Event escalation every step LLM / decision event only token cost, latency, recovery success

3. 2순위: Planner 논문

후보 제목

Evidence-Axis Preclassification and Pairwise Second-Pass Judging for Noisy Speech Routing

핵심 아이디어

preclassifier는 의미를 최종 판단하지 않는다. 대신 아래 판단 축을 만든다.

device action axis
schedule axis
device knowledge axis
public information axis
conversation axis
stt-null risk axis
unsupported execution axis

LLM planner는 이 축별 evidence와 registry/candidate pool을 보고 dominant first-response direction을 고른다. 애매한 DEF/STT_NULL/FRG 회색지대는 pairwise judge로 좁게 다시 판단한다.

예상 기여

실험 설계

실험 비교군 지표
Evidence layer ablation LLM only / evidence+LLM family accuracy
Second pass ablation off / DEF-STT only / DEF-STT-FRG gray-zone correction rate
Confidence self-report no self-report / runner-up+needs_second_pass unnecessary second pass rate
STT subtype no subtype / HARD-GENERIC-SOFT repair appropriateness

4. 3순위: TaskManager 논문

후보 제목

Event-Driven Task Orchestration for LLM-Planned Device Workflows

핵심 아이디어

LLM planner가 만든 복합명령 step을 매번 Cloud에서 직접 실행 판단하면 latency와 token cost가 커진다. 대신 DeviceAgent 내부에 TaskManager를 두고, task/workflow/event/reason lifecycle을 로컬에서 관리한다. Cloud는 최초 plan과 재계획이 필요한 이벤트에만 개입한다.

구현 근거

계층 구현 근거
Entry hook MainApi.executeMethod(...) -> TaskManager.handleControlMethod(...) -> TaskManager.executeLegacy(...)
Control API submitTask, submitWorkflow, getTaskStatus, listTasks, getQueueStatus, updateTaskProgress, cancelTask, getTaskManagerStatus, getDevicePlanningContext, classifyTaskIngress
Queue policy TaskPolicyRegistry의 movement/cleaning/state/update/sound/settings/ai/default queue
Execution mode DIRECT, QUEUED_WAIT, ASYNC
Workflow sequential subtask와 parallelGroup 지원
Event TaskEventListener, onTaskEvent, STARTED/PROGRESS/COMPLETED/FAILED/CANCELLED/WORKFLOW_STEP_*
Reason TaskReasonContractreason_code, recoverability, suggestedAction, requiresCloudDecision

실험 설계

실험 비교군 지표
Direct vs TaskManager legacy direct call / task lifecycle wrapping trace completeness, cancel success, status visibility
Cloud involvement every step LLM / decision-event-only token cost, end-to-end latency
Workflow runtime sequential only / sequential+parallel group workflow completion rate
Reason contract free-text error / structured reason_code replan accuracy, vendor debug time

5. 4순위: Memory/Proactive 논문

후보 제목

Temporal Context Modeling for Reactive and Proactive Speech-LLM Robots

핵심 아이디어

현재 A2A는 과거와 현재 context를 다룬다.

과거: 대화 history, voice context, workflow/task event history
현재: Device Planning Context, task queue, battery, map, movement, cleaning state
미래: 변화량/추세 기반 예측 context

미래 방향은 변화량을 context로 만들어 proactive decision gate에 넣는 것이다.

예:

battery_delta = -8% / 10min
movement_failures_recent = 2
predicted_battery_after_workflow = 8%
risk = workflow_completion_unlikely

실험 설계

실험 비교군 지표
Memory tier ablation no memory / short / short+mid / short+mid+long context continuity, user correction rate
Proactive gate rule-only / LLM-gated / hybrid false proactive rate, accepted suggestion rate
Temporal context current only / current+delta risk prediction precision

6. 논문 작성 우선순위

순위 먼저 해야 하는 일 이유
1 시스템 논문 outline 작성 전체 프레임을 먼저 고정해야 후속 논문들이 같은 용어를 쓴다
2 Planner benchmark/evidence 정리 현재 데이터와 실험 로그가 가장 많다
3 TaskManager 구현/테스트 evidence 정리 코드 구현이 진행되어 있어 논문의 engineering contribution이 선명하다
4 Memory/proactive는 position/workshop paper로 분리 아직 구현보다 방향성이 강하므로 미래 연구로 두는 편이 안전하다

7. 논문별 필요한 추가 evidence

논문 축 필요한 evidence
시스템 논문 end-to-end scenario 5~10개, latency/token/route/task success 표
Planner 논문 benchmark set, family별 confusion matrix, ablation table
STT_NULL 논문 HARD/GENERIC/SOFT subtype별 샘플과 human naturalness label
TaskManager 논문 unit test 목록, dry-run workflow 로그, queue/event/reason trace
Memory 논문 memory tier schema, 실제 personalization scenario
Proactive 논문 sensor/event signal 정의, false positive 방지 정책

8. 지금 기준 결론

현 상태에서 바로 논문화 가능한 것은 하나의 대형 시스템 논문과 두 개의 모듈 논문이다.

1. A2A Speech-LLM System Paper
2. Planner / STT Noise Routing Paper
3. DeviceAgent TaskManager / Event-Driven Replanning Paper

이 세 편은 같은 시스템을 서로 다른 추상화 수준에서 설명한다. 시스템 논문은 전체 철학과 구조를 설명하고, Planner 논문은 판단 품질을, TaskManager 논문은 실행 안정성과 비용 절감을 다룬다.

Keyboard shortcuts

⌘K / Ctrl+KOpen command palette
/Focus search
g hGo to home
g pGo to projects
g sGo to sessions
j / kNext / prev row (tables)
?Show this help
EscClose dialogs

Structured queries

Mix key:value filters with free text in the palette:

type:sessionOnly session pages
project:llm-wikiFilter by project name (substring)
model:claudeFilter by model name (substring)
date:>2026-03-01Sessions after a date
date:<2026-04-01Sessions before a date
tags:rustPages mentioning a tag/topic
sort:dateSort results by date (newest first)

Example: type:session project:llm-wiki date:>2026-04 sort:date