A2A Research Paper Topics
이 문서는 현재 SK-Intellix wiki에 정리된 A2A, Speech-LLM, DeviceAgent TaskManager, memory, context-aware, reactive/proactive 작업을 논문 주제로 분해한 것이다.
Planner와 의미 축 조정, context-aware routing을 외부 연구 프레임과 연결하는 읽기 자료는 A2A Planner Research Reading List에서 본다. 이 문서는 SayCan, LLM-Planner, intent/slot filling, clarification, OOD detection, decision-boundary calibration을 현재 A2A Planner와 매핑한다.
Planner/Runtime/TaskManager의 feedback을 강화학습 유사 개선 루프로 해석하는 기획/구조 관점은 A2A RL-Like Feedback Improvement Opportunities에서 본다.
핵심 관점은 하나다.
현재 작업은 단순 음성 명령 라우터가 아니라, STT 기반 사용자 발화, 과거 대화 맥락, 현재 기기 상태, 실행 중 task event를 함께 해석해 로봇/기기 행동을 계획하는 Speech-LLM 기반 의사결정 제어 계층이다.
1. 전체 논문 포트폴리오
| 번호 | 논문 후보 | 핵심 질문 | 현재 wiki 근거 |
|---|---|---|---|
| 1 | Context-Aware Agent-to-Agent Planning for Speech-Driven Device Robots | STT 발화와 context를 함께 넣으면 agent planning이 어떻게 안정화되는가 | Presentation Storyline, Speech-LLM Context-Aware A2A |
| 2 | Evidence-Axis Preclassification for Robust LLM Routing | LLM 호출 전 deterministic evidence layer가 왜 필요한가 | Planner Deep Dive |
| 3 | Robust STT_NULL Recovery under Noisy Speech | 깨진 STT와 짧은 대화/외부질문 회색지대를 어떻게 구분할 것인가 | Planner Deep Dive, benchmark 결과 문서 |
| 4 | LLM-Planned Multi-Step Device Task Orchestration | 복합 음성명령을 ordered step과 device task workflow로 어떻게 변환하는가 | Device Task Flow, DeviceAgent TaskManager 기준 사양서 |
| 5 | DeviceAgent TaskManager as a Unified Execution Framework | Cloud/MQTT/App/예약/로컬 음성 명령을 하나의 lifecycle로 관리할 수 있는가 | DeviceAgent TaskManager 기준 사양서, SoC TaskManager Framework |
| 6 | Event-Driven Replanning for Speech-LLM Robots | 모든 task마다 LLM을 호출하지 않고 판단 필요 이벤트에서만 재계획할 수 있는가 | Task Event Contract, DeviceAgent TaskManager 기준 사양서 |
| 7 | Reactive and Proactive Decision Control for Home Robots | reactive 발화와 proactive signal을 같은 planner/runtime 철학으로 묶을 수 있는가 | Reactive and Proactive Operation |
| 8 | Memory-Aware Speech Agent Routing and Personalization | 단기/중기/장기 memory가 routing과 응답에 어떤 영향을 주는가 | Memory and Personalization, Memory DB and Sync |
| 9 | Catalog-Grounded Agent Selection for LLM Orchestration | LLM의 tool/agent hallucination을 registry와 candidate pool로 줄일 수 있는가 | Planner Deep Dive, Contracts |
| 10 | Speech-First Robot Command Benchmark | STT noise, fragment, 복합명령, 기기제어, 외부검색을 포함한 benchmark를 어떻게 설계할 것인가 | benchmark/evidence 문서, Validation Guide |
2. 1순위: 시스템 논문
후보 제목
Context-Aware Agent-to-Agent Planning for Speech-Driven Device Robots
주장
음성 기반 로봇/기기 제어에서 LLM을 단순 intent classifier로 쓰면 STT noise, context continuation, 복합명령, device state constraint를 안정적으로 다루기 어렵다. 이를 해결하기 위해 preclassifier evidence, registry-grounded candidate pool, main planner LLM, second-pass judge, device task runtime을 분리한 A2A planning architecture가 필요하다.
예상 기여
| 기여 | 내용 |
|---|---|
| Architecture | Speech input에서 agent plan과 device task request까지 이어지는 end-to-end 구조 |
| Context Model | 과거 대화/voice context, 현재 device planning context, 미래 변화량 context 방향 제안 |
| Planner Contract | turn_mode, selected_routes, steps, input_from, missing_slots, device_task_requests |
| Runtime Boundary | Cloud는 plan과 판단, DeviceAgent는 task execution과 event/reason 관리 |
| Safety Boundary | normal event는 local 처리, 실패/차단/재계획 필요 이벤트만 Cloud escalate |
실험 설계
| 실험 | 비교군 | 측정 지표 |
|---|---|---|
| Context ablation | text only / voice context / device context / both | route accuracy, executable plan validity |
| Planner contract ablation | family only / steps included / dependency included | multi-step success, wrong dependency rate |
| Device context ablation | context 없음 / battery-map-task 상태 포함 | impossible plan rate, early rejection precision |
| Event escalation | every step LLM / decision event only | token cost, latency, recovery success |
3. 2순위: Planner 논문
후보 제목
Evidence-Axis Preclassification and Pairwise Second-Pass Judging for Noisy Speech Routing
핵심 아이디어
preclassifier는 의미를 최종 판단하지 않는다. 대신 아래 판단 축을 만든다.
device action axis
schedule axis
device knowledge axis
public information axis
conversation axis
stt-null risk axis
unsupported execution axis
LLM planner는 이 축별 evidence와 registry/candidate pool을 보고 dominant first-response direction을 고른다. 애매한 DEF/STT_NULL/FRG 회색지대는 pairwise judge로 좁게 다시 판단한다.
예상 기여
- keyword rule과 LLM-only routing 사이의 중간 구조 제안
- STT noise 환경에서
STT_NULL을 과대/과소 판단하지 않기 위한 second-pass 구조 - route family accuracy뿐 아니라 acceptable ambiguity와 naturalness를 함께 보는 평가 기준
실험 설계
| 실험 | 비교군 | 지표 |
|---|---|---|
| Evidence layer ablation | LLM only / evidence+LLM | family accuracy |
| Second pass ablation | off / DEF-STT only / DEF-STT-FRG | gray-zone correction rate |
| Confidence self-report | no self-report / runner-up+needs_second_pass | unnecessary second pass rate |
| STT subtype | no subtype / HARD-GENERIC-SOFT | repair appropriateness |
4. 3순위: TaskManager 논문
후보 제목
Event-Driven Task Orchestration for LLM-Planned Device Workflows
핵심 아이디어
LLM planner가 만든 복합명령 step을 매번 Cloud에서 직접 실행 판단하면 latency와 token cost가 커진다. 대신 DeviceAgent 내부에 TaskManager를 두고, task/workflow/event/reason lifecycle을 로컬에서 관리한다. Cloud는 최초 plan과 재계획이 필요한 이벤트에만 개입한다.
구현 근거
| 계층 | 구현 근거 |
|---|---|
| Entry hook | MainApi.executeMethod(...) -> TaskManager.handleControlMethod(...) -> TaskManager.executeLegacy(...) |
| Control API | submitTask, submitWorkflow, getTaskStatus, listTasks, getQueueStatus, updateTaskProgress, cancelTask, getTaskManagerStatus, getDevicePlanningContext, classifyTaskIngress |
| Queue policy | TaskPolicyRegistry의 movement/cleaning/state/update/sound/settings/ai/default queue |
| Execution mode | DIRECT, QUEUED_WAIT, ASYNC |
| Workflow | sequential subtask와 parallelGroup 지원 |
| Event | TaskEventListener, onTaskEvent, STARTED/PROGRESS/COMPLETED/FAILED/CANCELLED/WORKFLOW_STEP_* |
| Reason | TaskReasonContract의 reason_code, recoverability, suggestedAction, requiresCloudDecision |
실험 설계
| 실험 | 비교군 | 지표 |
|---|---|---|
| Direct vs TaskManager | legacy direct call / task lifecycle wrapping | trace completeness, cancel success, status visibility |
| Cloud involvement | every step LLM / decision-event-only | token cost, end-to-end latency |
| Workflow runtime | sequential only / sequential+parallel group | workflow completion rate |
| Reason contract | free-text error / structured reason_code | replan accuracy, vendor debug time |
5. 4순위: Memory/Proactive 논문
후보 제목
Temporal Context Modeling for Reactive and Proactive Speech-LLM Robots
핵심 아이디어
현재 A2A는 과거와 현재 context를 다룬다.
과거: 대화 history, voice context, workflow/task event history
현재: Device Planning Context, task queue, battery, map, movement, cleaning state
미래: 변화량/추세 기반 예측 context
미래 방향은 변화량을 context로 만들어 proactive decision gate에 넣는 것이다.
예:
battery_delta = -8% / 10min
movement_failures_recent = 2
predicted_battery_after_workflow = 8%
risk = workflow_completion_unlikely
실험 설계
| 실험 | 비교군 | 지표 |
|---|---|---|
| Memory tier ablation | no memory / short / short+mid / short+mid+long | context continuity, user correction rate |
| Proactive gate | rule-only / LLM-gated / hybrid | false proactive rate, accepted suggestion rate |
| Temporal context | current only / current+delta | risk prediction precision |
6. 논문 작성 우선순위
| 순위 | 먼저 해야 하는 일 | 이유 |
|---|---|---|
| 1 | 시스템 논문 outline 작성 | 전체 프레임을 먼저 고정해야 후속 논문들이 같은 용어를 쓴다 |
| 2 | Planner benchmark/evidence 정리 | 현재 데이터와 실험 로그가 가장 많다 |
| 3 | TaskManager 구현/테스트 evidence 정리 | 코드 구현이 진행되어 있어 논문의 engineering contribution이 선명하다 |
| 4 | Memory/proactive는 position/workshop paper로 분리 | 아직 구현보다 방향성이 강하므로 미래 연구로 두는 편이 안전하다 |
7. 논문별 필요한 추가 evidence
| 논문 축 | 필요한 evidence |
|---|---|
| 시스템 논문 | end-to-end scenario 5~10개, latency/token/route/task success 표 |
| Planner 논문 | benchmark set, family별 confusion matrix, ablation table |
| STT_NULL 논문 | HARD/GENERIC/SOFT subtype별 샘플과 human naturalness label |
| TaskManager 논문 | unit test 목록, dry-run workflow 로그, queue/event/reason trace |
| Memory 논문 | memory tier schema, 실제 personalization scenario |
| Proactive 논문 | sensor/event signal 정의, false positive 방지 정책 |
8. 지금 기준 결론
현 상태에서 바로 논문화 가능한 것은 하나의 대형 시스템 논문과 두 개의 모듈 논문이다.
1. A2A Speech-LLM System Paper
2. Planner / STT Noise Routing Paper
3. DeviceAgent TaskManager / Event-Driven Replanning Paper
이 세 편은 같은 시스템을 서로 다른 추상화 수준에서 설명한다. 시스템 논문은 전체 철학과 구조를 설명하고, Planner 논문은 판단 품질을, TaskManager 논문은 실행 안정성과 비용 절감을 다룬다.