Qwen-AgentWorld-35B-A3B: MCP, 터미널, SWE, 안드로이드, 웹 및 OS 환경을 시뮬레이션하도록 훈련된 3B 활성 파라미터 MoE 모델
Qwen-AgentWorld-35B-A3B: a 3B-active MoE trained to simulate MCP, terminal, SWE, Android, web and OS environments
핵심 요약
에이전트의 행동에 따른 환경 변화를 예측하는 새로운 언어 월드 모델 Qwen-AgentWorld-35B-A3B가 공개되었습니다.
- 모델 구조 — 토큰당 약 3B 파라미터만 활성화되는 35B MoE 모델임
- 월드 모델 — 에이전트의 행동 후 환경의 반응을 예측하는 데 특화됨
- 지원 도메인 — MCP, 터미널, 소프트웨어 공학, 안드로이드, 웹 등 7개 분야를 다룸
- 활용 사례 — 에이전트 훈련, 오프라인 평가, 합성 데이터 생성 및 샌드박스 환경 구축에 유용함
Qwen이 방금 Qwen-AgentWorld-35B-A3B를 출시했습니다. 토큰당 약 3B의 활성 파라미터만 사용하는 35B 파라미터 MoE 모델입니다.
흥미로운 점은 이 모델이 표준 챗/인스트럭션 모델이나 완전한 자율 에이전트로 포지셔닝되지 않았다는 것입니다. 이 모델은 에이전트가 행동을 취한 후 환경이 무엇을 반환할지 예측하도록 훈련된 언어 월드 모델입니다.
이 모델은 7가지 에이전트 상호작용 도메인을 다룹니다:
MCP / 도구 호출
검색
터미널
소프트웨어 공학
안드로이드
웹
운영체제 GUI 상호작용
의도된 사용 목적은 에이전트 루프의 환경 측면을 시뮬레이션하는 것으로 보입니다. 행동 이력과 새로운 도구/GUI 행동이 주어지면 다음 관찰/상태를 예측하는 것이죠. 이는 에이전트 훈련, 오프라인 평가, 합성 궤적 생성, 도구 사용 워크플로우 테스트, 또는 실제 도구를 계속 실행하지 않고도 샌드박스 같은 환경을 구축하는 데 유용할 수 있습니다.


