Qwen 3.5 35B에 p5.brush 그림 코드를 쓰게 한 RL, 쌍대 비교 보상으로 성능 개선
Hacker News opinions
LLM이 Logo도 코딩할 수 있나 궁금함. 이 방식으로 돌리면 흥미로운 디자인이 나올 듯함.
자바스크립트가 정확히 뭘 하는 건지 궁금했음.
p5.js로 그림을 그리는 코드임.
이런 방식이 사람에게 AI 사용법을 가르치는 데도 꽤 좋을 듯함. 프롬프트로 제약과 원하는 결과를 더 잘 표현하게 만들 수 있겠음.
발표 영상에서 이미지 생성기가 사용자를 창작자보다 구경꾼으로 만든다는 얘기가 특히 좋았음. 예전에 p5.js를 많이 만졌는데 다시 해보고 싶어짐. RL 부분은 내 수준보다 위 같긴 함.
SVG를 생성하는 이미지 모델도 대략 이런 식으로 학습하는지 궁금함. 이미지 조건부 LLM인지, SVG 호환 이미지를 내는 확산 잠재표현을 쓰는지도 알고 싶음.
2018년 논문에서 RL과 GAN으로 붓질을 학습한 작업이 떠오름. 픽셀 기반 GAN과 달리 장면을 기술적으로 생성하고 이해하려는 발상이 좋았는데, 현대 VLM 기법으로 이걸 잘 구현한 사례라 반가움.
나도 Rust 네이티브 모듈을 호출하는 Python 코드로 복셀 모델을 만드는 비슷한 작업을 하고 있음. 기대 이상으로 괜찮은 모델이 나오지만 아직 완벽하진 않음.
LLM으로 예전 의미의 생성 예술을 만들 방법을 고민해 왔음. 이 접근과 결과를 보니 반가움.