무엇을 연구할지 고르고,
그 판단의 근거를 지키다
Scientific Taste and Evidence-Preserving Memory: Three Shifts in AGI Research
실험을 실행하는 능력에서 가치 있는 실험을 선택하는 능력으로. 더 많은 기억에서 신뢰할 수 있는 기억으로. 세 연구가 드러낸 장기 과학지능의 과제를 살핀다.
Claude의 생물학적 후보 탐색, Taste-Bench의 사전 판단 평가, CliffCompaction의 원문 보존 압축은 서로 다른 문제를 다룬다. 함께 읽으면 연구방향을 선택하고 그 결정의 근거를 오래 유지하는 능력이 드러난다.
원자료 AGI-Trends-0924.md의 모든 연구 항목·수치·수식·비교 관점과 ARC 점검 기록을 반영했다. 개별 연구 결과와 첨부 브리핑의 종합 전망을 구분한다.
전체 목차
AGI 연구의 세 가지 이동
2026년 9월 24일 업데이트에서는 이전 업데이트 이후 새로 확인된 것 중 연구방향을 바꿀 가능성이 충분히 높은 변화 3건만 선별했다. 가장 큰 변화는 Autonomous AI Scientist가 기존 논문 재현이나 benchmark 연구를 넘어 실제 미지의 생물학적 후보를 찾아 wet-lab 검증으로 연결한 사례가 등장했다는 점이다. 동시에 long-horizon agent 연구에서는 “어떤 결정을 내릴지 고르는 연구적 판단(taste)”과 “기억을 요약할수록 생기는 drift를 어떻게 막을지”가 각각 독립적인 핵심능력으로 부상했다.
| 연구 신호 | 핵심 결과 | 해석의 경계 |
|---|---|---|
| Claude · ART | 미지의 생물학적 시스템 후보를 탐색하고 인간 실험으로 연결 | 기능 미확정 · 실험은 인간 수행 |
| Taste-Bench | 결과를 보기 전 선택하는 판단 능력 · 최고 59.7% | 해당 벤치마크와 실험 조건의 결과 |
| CliffCompaction | 재서술 없는 압축 · 비용 최대 약 50% 감소 | 원문 오류와 정보 누락까지 해소하지 않음 |
ART: 무엇을 발견할지 선택하다
Anthropic — Claude discovers a novel enzyme system with CRISPR-like repeats 발표일: 2026년 9월 23일 / 영역: Autonomous AI Scientist · Scientific General Intelligence
Anthropic의 새 life-sciences 연구그룹은 Claude agent들에게 “대규모 DNA 데이터베이스에서 흥미로운 reverse transcriptase(RT)를 찾아라”는 높은 수준의 지시를 주고, 이후 computational search와 후보 선정을 상당 부분 자율적으로 수행하게 했다. 약 950개 agent가 21시간 동안 2.1억 token을 사용해 20만 개 이상의 RT를 수집하고 약 3,500개 candidate system을 만든 뒤 20개 후보로 좁혔으며, 그중 한 agent가 RT 옆의 규칙적인 DNA repeat array를 발견했다. 연구팀은 이를 array-associated reverse transcriptases(ART)라고 명명했다. 기존 RT 자체는 과거 연구에 등장했지만, RT·비암호화 repeat array·추가 accessory protein이 하나의 system을 이룬다는 패턴은 이전에 보고되지 않았다고 Anthropic은 설명한다. 이후 인간 연구자가 실험실에서 repeat array가 distinct short RNA로 발현됨을 확인했다. 다만 ART의 실제 생물학적 기능은 아직 밝혀지지 않았고, 모든 wet-lab 실험은 인간 연구자가 수행했다. 근거 1
기존 연구 대비 차이가 중요하다. 첨부 브리핑은 비교 대상으로 ScientistTwo, ScienceBuddy류를 들며, 주로 알려진 computational research problem이나 benchmark를 중심으로 가설 → 코드 → 실험 → 논문을 자동화했다. 이번 사례는
으로 연구루프가 확장됐다. 즉 “정답이 이미 존재하는 benchmark를 얼마나 잘 푸는가?”보다 미리 정답을 알 수 없는 데이터 공간에서 무엇을 조사할 가치가 있는지 스스로 선택하는 능력을 실제 과학 discovery에 적용했다. 근거 1
연구적 의미: 이것을 “AI가 완전자율적으로 새로운 CRISPR를 발견했다”고 해석하는 것은 과장이다. 기능은 아직 미확정이고 실험은 인간이 수행했다. 그러나 AI가 단순 분석도구가 아니라 discovery-space search와 scientific triage를 담당하고, 인간은 expensive verification을 수행하는 구조가 실제 wet science로 넘어가기 시작했다는 것은 상당히 의미 있는 변화이다. 첨부의 전망에 따르면 향후 Autonomous AI Scientist의 핵심 benchmark는 기존 논문 재현율보다 novel-candidate yield, false-discovery rate, experimental hit rate, cost per validated hypothesis, independent replication 쪽으로 이동할 가능성이 높다.
Anthropic — Claude discovers a novel enzyme system with CRISPR-like repeats
RT 자체의 최초 발견, 새로운 시스템 패턴의 식별, 기능의 실험적 규명은 서로 다른 주장이다. 여기서 보고된 진전은 시스템 패턴을 찾아 후보로 제시하고 일부 실험적 특성을 확인한 단계이다. 수식의 wet-lab falsification은 검증·반증을 지향하는 연구 흐름을 표현하며, ART의 기능 가설이 이미 최종 판정됐다는 의미가 아니다.
Taste: 결과를 보기 전에 판단하다
Wenbo Pan et al. — The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks 발표일: 2026년 9월 22일 / 영역: Long-Horizon Agents · Autonomous AI Scientist · AGI Evaluation
이 논문은 long-horizon agent에서 중요한데 제대로 측정되지 않던 능력을 “taste”라는 독립 평가축으로 정의한다. 여기서 taste는 스타일이나 선호가 아니라, 장기 연구·엔지니어링 과정에서 “어느 가설을 시험할 것인가, 어느 구현을 유지할 것인가, 어느 방향을 버릴 것인가”를 결과를 보기 전에 선택하는 능력이다. 연구진은 실제 agent trajectory의 decision fork를 자동 추출해 Taste-Bench를 만들었다. 평가 모델은 fork 이후 결과를 보지 못한 상태에서 더 나은 방향을 골라야 하며, 최고 frontier model조차 59.7%에 머물렀다. 특히 올바른 판단에 필요한 증거가 trajectory 후반에 나타날수록 모든 모델이 더 어려워했고, reasoning token budget을 늘리는 것만으로는 성능이 개선되지 않았다. 반면 미래 결과를 본 teacher의 판단을 student에게 distill하면 unseen task의 판단능력과 held-out SWE-bench Pro end-to-end 성능이 함께 개선됐다. 근거 2
기존 연구 대비 차이: 기존 long-horizon benchmark는 대체로
만 측정했다. Taste-Bench는 이를
로 분해한다. 따라서 실패가 “코딩을 못해서”인지, “추론이 부족해서”인지, 아니면 초기에 연구방향을 잘못 골라서인지 구별할 수 있게 된다. 근거 2
연구적 의미: 최근 frontier 연구소들이 AI-R&D automation에서 남은 인간 우위로 research taste, direction setting, when to stop을 지목해 왔는데, 이 논문은 그 추상적 개념을 학습·평가 가능한 capability로 바꾼다. 이것이 재현된다면 Autonomous AI Scientist의 다음 병목은
보다
가 된다. AGI 평가에서도 결과 정답률과 별도로 decision quality under delayed evidence를 측정하는 흐름이 커질 가능성이 높다.
판독 범위 · 59.7%는 해당 Taste-Bench의 선택 정확도이다. 모든 과학 연구에서 인간과 AI의 판단 능력을 비교한 수치가 아니다. 최초 공개일은 9월 22일이며, 9월 23일 v2가 공개됐다. 추론 예산과 증류에 관한 결론은 논문이 실험한 조건에 한정한다.
Memory: 근거를 잃지 않고 오래 일하다
Trang Nguyen et al. — CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents 발표일: 2026년 9월 22일 / 영역: Lifelong Memory · Long-Horizon Agents · Continual Operation
CliffCompaction의 핵심은 “더 영리한 summary를 만들자”가 아니라 오히려 summary를 반복해서 다시 쓰지 말자는 것이다. 방법은 context를 압축할 때 원래 내용을 재서술하거나 새로운 요약문으로 생성하지 않고 원문 일부를 삭제하거나 truncate하는 방식만 사용한다. 또한 이전 compaction을 다시 compact하지 않고 매번 original content를 대상으로 새 compaction을 만들기 때문에, 장기간 반복되는 summary-of-summary에서 hallucination과 semantic drift가 누적되는 것을 구조적으로 피한다. Terminal-Bench에서 비용을 최대 약 50% 줄이면서 성능을 유지 또는 개선했고, 첨부는 동일 비용의 test-time scaling에서 10%p 이상 추가 성능을 얻었다고 정리한다. 논문 초록의 정확한 표현은 full-context 실행 두 번보다 낮은 비용에서 Terminal-Bench 성능이 10%p 이상 개선됐다는 것이다. KernelBench에서는 100만 token을 넘는 세션과 400-step 규모의 continual process에서도 성능 향상이 지속됐다. 근거 3
기존 연구 대비 차이: 최근 memory architecture들은 흔히
처럼 기존 memory를 계속 재서술한다. 문제는 작은 왜곡이 반복될수록 누적될 수 있다는 점이다. CliffCompaction은 사실상
라는 보수적 원칙을 택한다. 즉 압축 연산만 놓고 보면 정보를 덜 보존할 수는 있어도 새로운 사실을 만들어 넣지 않는 memory이다. 원문에 이미 포함된 오류나 삭제로 인한 맥락 손실까지 제거한다는 뜻은 아니다. 근거 3
연구적 의미: 이는 지난 업데이트들에서 나타난 memory corruption, future-update sufficiency, compaction as persistent control state 문제와 직접 연결된다. 장기 AGI의 memory 설계가
보다는
를 우선해야 한다는 근거가 강해지고 있다. 특히 수일~수개월 동안 동작하는 coding agent나 AI Scientist에서는 생성형 memory보다 evidence-preserving memory가 더 안전한 기본값일 수 있다는 방향 전환이다.
기억의 신뢰성 · 원문 보존은 압축 과정의 재서술 오류를 줄이는 설계 원칙이다. 필요한 증거의 누락, 원문 자체의 오류, 장기 복구 비용은 별도로 평가해야 한다. 수일~수개월 운용의 안전성은 이 실험만으로 확정되지 않으며, 아래 연구방향은 첨부의 해석이다.
감사 가능한 AI Scientist를 향하여
이번 세 결과를 같이 보면 AGI 연구의 병목이 다시 한 단계 이동하고 있다.
따라서 현재 가장 주목할 연구축은 Scientific Taste, Prospective Discovery Benchmarks, Evidence-Preserving Memory, 그리고 이 연구축들을 결합한 Autonomous Scientist whose hypotheses, decisions, and memory are externally auditable라고 판단한다.
첨부의 9월 24일 점검 기록에 따르면 ARC Prize 공식 채널에는 2026년 9월 22일 GPT‑6 Luna 결과 이후 연구방향을 바꿀 수준의 새로운 verified ARC‑AGI 결과는 아직 확인되지 않았다. 첨부가 기록한 ARC‑AGI‑3의 다음 공식 milestone은 2026년 9월 30일이다. 근거 4
이 글의 기준일과 게시일은 원자료에 명시된 2026년 9월 24일이다. ARC 결과 변경 부재는 당시 첨부의 점검 범위에 관한 기록이며 모든 채널의 변경 부재를 보장하지 않는다. 세 연구를 연결한 연구축과 감사 가능한 AI Scientist는 종합적 연구 제안이지, 하나의 시스템에서 이미 입증된 AGI 능력을 뜻하지 않는다.
참고자료
- Claude discovers a novel enzyme system with CRISPR-like repeatsAnthropic · 2026-09-23 · 연구팀 공식 발표
- The Tasteful Agent: Measuring and Improving Taste in Long-Horizon TasksWenbo Pan et al. · 2026-09-22 · v2 2026-09-23
- CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding AgentsTrang Nguyen et al. · 2026-09-22
- ARC Prize — Official Results공식 결과 목록 · 당시 점검 기록의 확인 경로
- ARC Prize 2026 — ARC-AGI-3 Competition공식 대회 일정 · milestone 확인 경로
수식은 원자료의 연구 흐름과 설계 원칙을 표현한 개념식이다. 비용 절감의 상한, 벤치마크별 판단 정확도, 생물학적 기능 입증은 서로 다른 평가 대상이다.